v0.32.10-rc0: nvfp4ダブルスケールモデルのプリフィル高速化v0.32.10-rc0: nn: speed up prefill on double-scale nvfp4 models
匿名の公開いいねです。記事の保存・お気に入りではなく、Featured、Top 3、重要度、掲載順位には影響しません。仕組みとプライバシーAnonymous public likes are reactions, not saved articles or bookmarks. They do not affect Featured, Top 3, importance, or listing order.How it works and privacy
ModelOptチェックポイントが持つfloat32グローバルスケールの適用を単一のfused kernelで処理することで、余分なカーネル起動と中間バッファを削減し、nvfp4モデルのプリフィル速度を向上させた。
Ollama v0.32.10-rc0 fuses the float32 global-scale multiply and dtype cast into a single kernel for double-scale nvfp4 models, eliminating an extra kernel launch and intermediate buffer per projection to speed up prefill.
本ページの要約は AI による自動生成です。日本語版と英語版は言語ごとに独立して生成されるため、表現や詳しさが異なる場合があります。正確性は元記事 (github.com) をご確認ください。The summaries are AI-generated independently for each language, so wording and detail may differ. Verify accuracy at the original source (github.com).




