← 一覧に戻る

LLM Stats

Summer 2025活動中

独立したAI評価ラボ

サマリー
AI開発者向けに、LLMの実世界性能を測る独立評価とベンチマーク情報を提供する
課題
既存ベンチマークは多くのモデルの学習データに含まれ、性能を正確に比較しにくい
解決策
汚染耐性のある独立ベンチマークと評価を実施し、LLMの結果を網羅的なleaderboardで比較可能にする

AI による要約

業種
B2Bインフラ
所在地
New York City, NY, USA
チーム規模
2

事業内容

実環境での性能を測定する、独立性が高くデータ汚染に強いベンチマークを構築する。 LLM Statsは、最も包括的なLLMリーダーボードを提供する。LLMベンチマーク結果の最大規模のアーカイブを保有し、多くのモデルの学習データにすでに含まれている従来型のベンチマークとは異なる、独立した評価も実施する。 ミッションは、AIの透明性に取り組む最大のコミュニティになること。

公式サイト ↗YC のページ ↗