LLM Stats
Summer 2025活動中独立したAI評価ラボ
- サマリー
- AI開発者向けに、LLMの実世界性能を測る独立評価とベンチマーク情報を提供する
- 課題
- 既存ベンチマークは多くのモデルの学習データに含まれ、性能を正確に比較しにくい
- 解決策
- 汚染耐性のある独立ベンチマークと評価を実施し、LLMの結果を網羅的なleaderboardで比較可能にする
AI による要約
- 所在地
- New York City, NY, USA
- チーム規模
- 2 人
事業内容
実環境での性能を測定する、独立性が高くデータ汚染に強いベンチマークを構築する。 LLM Statsは、最も包括的なLLMリーダーボードを提供する。LLMベンチマーク結果の最大規模のアーカイブを保有し、多くのモデルの学習データにすでに含まれている従来型のベンチマークとは異なる、独立した評価も実施する。 ミッションは、AIの透明性に取り組む最大のコミュニティになること。