HomeLocal LLM / Open Models新世代Qwen3.6を4070で測ったら「前世代の半速」に見えた。だが犯人はモデルではなかった

新世代Qwen3.6を4070で測ったら「前世代の半速」に見えた。だが犯人はモデルではなかったOn an RTX 4070, Qwen first looked half as fast as the prior generation, but…

AI要点サマリSummary highlight

RTX 4070でQwenのMoEモデルを測ると当初は前世代の半速に見えたが、原因はモデルでなく構成にあり、エキスパートをCPUにオフロードすると2.8倍速い34.6 tok/sを達成し、標準7問で全問正解した。

On an RTX 4070, Qwen first looked half as fast as the prior generation, but offloading MoE experts to the CPU gave a 2.8x speedup to 34.6 tok/s with 7/7 correct, proving the config—not the model—was the culprit.

  • 出典SourceQiita LLMコミュニティCommunity
  • 直近30件の平均重要度Avg importance, last 301=Info · 2=Medium · 3=High
  • 配信形式FormatブログBlog
  • 重要度Importance重要度 MediumMedium priority(Local LLM / Open Models 230件中、同等以上 207件)(207 of 230 Local LLM / Open Models entries are equal or higher)
  • 情報の寿命Half-life📘 中期 (チュートリアル)Medium-term (tutorial)
  • 原文言語Source languageJA
  • 収集日時Collected2026/06/21 11:00

本ページの要約は AI による自動生成です。日本語版と英語版は言語ごとに独立して生成されるため、表現や詳しさが異なる場合があります。正確性は元記事 (qiita.com) をご確認ください。The summaries are AI-generated independently for each language, so wording and detail may differ. Verify accuracy at the original source (qiita.com).

🏠Local LLM / Open Models の他の記事More from Local LLM / Open Modelsもっと見る →View more →