Pokémonでさえ、AIのベンチマーク論争から安全ではありません。 Xに関する最近の投稿は、GoogleのGeminiモデルが元のPokémonゲームで人類のクロードモデルよりも優れていると主張し、ベンチマーク方法に関する議論を引き起こしました。
先週、Xの投稿がバイラルになり、Googleの最新のGeminiモデルが元のPokémonビデオゲームの三部作で人類のフラッグシップクロードモデルを上回ったと主張しました。伝えられるところによると、ジェミニは開発者のひきつりの流れでラベンダーの町に到着しました。クロードは2月下旬にマウントムーンで立ち往生しました。投稿には、「ジェミニはラベンダーの町に到達した後、ポケモンのクロードATMよりも文字通り先を行っています」と書かれており、「119のライブビューだけ、信じられないほど過小評価されているストリーム」というコメントに、ストリームのスクリーンショットが含まれていました。
しかし、後にジェミニには不公平な利点があることが明らかになりました。 Redditのユーザーは、Geminiストリームを維持している開発者が、モデルがカットテーブルツリーなどのゲームで「タイル」を識別するのに役立つカスタムミニマップを構築したことを指摘しました。このカスタムミニマップは、ゲームプレイの決定を下す前にジェミニがスクリーンショットを分析する必要性を減らし、大きな優位性を与えます。
Pokémonは、せいぜい半精力的なAIベンチマークと見なされますが、ベンチマークの異なる実装が結果にどのように影響するかの有益な例として機能します。この論争は、AIベンチマークの欠陥と、カスタム実装がモデルを正確に比較することを困難にする方法を強調しています。
この問題はポケモンに固有のものではありません。人類は、モデルのコーディング能力を評価するSWEベンチ検証ベンチマーク上のClaude 3.7ソネットモデルの2つの異なるスコアを報告しました。 「カスタム足場」がなければ、Claude 3.7 Sonnetは62.3%の精度を達成しましたが、カスタム足場では、精度は70.3%に増加しました。同様に、メタは、LMアリーナベンチマークでパフォーマンスを向上させるために、Llama 4 Maverickモデルのバージョンを微調整しました。微調整されたバージョンは、同じ評価でバニラバージョンよりも大幅に高く採点されました。
AIベンチマークが最初から不完全な測定値であることを考えると、カスタムおよび非標準の実装はモデルの比較をさらに複雑にします。その結果、モデルがリリースされると、モデルを比較することがますます困難になる可能性があります。








