← ブログ一覧に戻る

#ベンチマーク

3件の記事があります

ScienceAgentBench: 研究タスクにおけるPythonコード生成ベンチマーク

ScienceAgentBench: 研究タスクにおけるPythonコード生成ベンチマーク

BixBench:Bioinformaticsタスクに対するAIエージェントのベンチマーク

FutureHouseとScienceMachineが共同開発したバイオインフォマティクス分野のAIエージェント評価ベンチマーク

AI4Science評価データ FrontierScience(OpenAI)の概要と簡易検証

OpenAIのAI4Science評価データ「FrontierScience」を実際に使ってみた試行録です。Olympiad/Research両タスクを簡易的に検証し、所感をまとめました。