Deepseekの研究者は月曜日に、新しい実験モデルv3.2-Expをリリースしました。これは、長いコンテキスト操作で使用すると劇的に推論コストを削減するように設計されています。 Deepseekは、このモデルを抱きしめる顔に関する投稿で発表し、GitHubにリンクされたアカデミックペーパーを公開し、そのアーキテクチャとパフォーマンスの詳細を提供しました。モデルの最も重要な機能は、DeepSeekスパースの注意と呼ばれます。このシステムは、コンテキストウィンドウからの特定の抜粋に優先順位を付けるために、「稲妻のインデクサー」と呼ばれるモジュールを使用します。そのステップの後、別のシステムである「細かい粒状トークン選択システム」は、これらの抜粋内から特定のトークンを選択します。これらの選択されたトークンは、モジュールの限られた注意ウィンドウにロードされます。この組み合わせにより、まばらな注意モデルは、サーバーの負荷が比較的小さなコンテキストの長い部分にわたって動作することができます。システムの利点は、長いコンテキスト操作にとって重要です。 DeepSeekが実施した予備的なテストでは、これらの状況では、簡単なAPI呼び出しの価格が半分だけ削減できることがわかりました。クレームのより堅牢な評価を構築するには、さらなるテストが必要になります。このモデルはオープンウェイトであり、顔を抱きしめて自由に利用できます。これにより、サードパーティのテストが論文に示されている結果を評価できるようになります。 Deepseekの新しいモデルは、推論コストの問題に対処する最近の一連のブレークスルーの一部です。これらのコストは、事前に訓練されたAIモデルを操作するためのサーバー費用を表しています。これは、トレーニングのコストとは異なります。 Deepseekの研究者は、基本的な変圧器アーキテクチャをより効率的に動作させる方法を探していました。中国に本拠を置くDeepseekは、AIセクターの珍しい人物、特にAIの研究を米国と中国の間の民族主義的な闘争と見なしている人々にとっては珍しい人物でした。同社は、R1モデルで年の初めに注目を集めました。R1モデルは、主にアメリカの競合他社よりもはるかに低いコストで補強学習を使用して訓練されました。しかし、このモデルは、一部の人が予測したようにAIトレーニングにおける卸売革命を引き起こすことはなく、それ以来、同社はスポットライトから後退しました。新しい「まばらな注意」アプローチは、R1と同じ騒動を生み出すことはほとんどありませんが、プロバイダーに、推論のコストを低く抑えるためにいくつかの非常に必要なトリックを教えることができます。

Source: DeepSeekは、v3.2-Expモデルをまばらな注意を払ってリリースします

  Microsoft Windows 11 25H2はリリースプレビューチャネルに入ります