TAG

#ベンチマーク5件

#ベンチマーク に関連する記事を横断して確認できます。特定テーマの変化を追う入口です。

研究

Google、AIコーディング能力を測る「Android Bench 2.0」公開

Googleは、AIモデルやエージェントのコーディング能力を評価するための新たなベンチマーク「Android Bench 2.0」を発表しました。この新ベンチマークは、実際のソフトウェアエンジニアが数日を要するような複雑な長期タスクをAIに課すよう刷新されています。その結果、従来のベンチマークで約91%だった最高通過率が、約28%へと大幅に低下しました。

ITmedia AI+
研究

AIベンチマーク飽和:進化するAIの評価指標の限界

AIの性能評価で用いられるベンチマークテストにおいて、「ベンチマーク飽和」という現象が問題視されています。これは、最先端のAIシステムがテストの限界に到達し、スコアのわずかな差がモデルの真の能力を正確に反映しなくなる状態を指します。

Unite.AI
エージェント

Sierra、AIエージェント構築の新ベンチマーク公開

AI開発企業Sierraは、AIコーディングエージェントが機能するカスタマーサービスエージェントを構築する能力を測る新たな長期ベンチマーク「Hyper-τ-Bench」をオープンソースとして公開しました。この評価ツールによると、AI単独でのエージェント構築能力はまだ限定的で、人間と先進AIモデルの組み合わせには大きく及ばないことが示されています。

Unite.AI
研究

LLMベンチマーク、真の能力を測れているか?

Hugging Faceが、大規模言語モデル(LLM)の性能を評価する既存のベンチマークが、モデルの真の能力を測定できているのかという根本的な疑問を投げかけました。「BenchMIRT」と題された同社のブログ記事では、ベンチマークが抱える課題を深く掘り下げ、より本質的な評価の必要性を強調しています。

Hugging Face Blog
AI活用

Claude Fable 5がベンチマーク高評価も企業導入に壁

最新の物理AIベンチマークにおいて、大規模言語モデル「Claude Fable 5」が最高評価を獲得しました。しかし、その高い性能にもかかわらず、企業が実ビジネスで導入を検討する際には、単純な性能比較だけでは見えない複雑な課題が存在することが明らかになりました。

ITmedia AI+