数学
ツリー全体 ・ 0 票
まだ投票がありません。最初の投票者になりましょう。
評価基準
※ tier はあくまで投票者個人の主観的な評価で大丈夫です。以下は投票時の目安です。
- S
おすすめ — ストレスなくタスクを実行可能。少ないプロンプト・ラリーで意図したモノを生成できる。コストパフォーマンスに優れる。ハルシネーションがほとんどない。
- A
良い — 熟練者であればほとんどのタスクを実行可能。最終的に意図したモノを生成できる。コストパフォーマンスは良い。ハルシネーションが少ない。
- B
普通 — 多くのプロンプト・ラリーによって意図したモノを生成できる。コストパフォーマンスは普通。エラーやハルシネーションが起きる。
- C
やや問題あり — どんなにラリーを重ねても意図したモノを生成できない可能性がやや高い。エラーやハルシネーションが多い。
- ✗
ほぼ不可能 — ほとんどの場合で意図したモノを生成できない。
Arena ベンチマークと比べる
arena.ai (旧 LMArena)のブラインド対戦 Elo を tier に換算した参考値です ・ arena.ai ・ データ: LMArena Leaderboard Dataset (CC BY 4.0)
この tier 表の読み方 (Arena とは?)
Arena (旧 LMArena)は、2 つの AI の回答を名前を伏せて見比べて良い方を選ぶ投票サイトです。世界中の投票がチェスと同じ Elo レーティングに集計されます。
トップとの Elo 差で tier にしています: 20 以内 = S、35 以内 = A、60 以内 = B、それより下 = C。
サービス表示では、同じサービスのモデルのうち最高スコアのものを代表にしています。
みんなの投票とのズレ
みんなの投票と共通のサービスがまだありません。投票が集まると比較が表示されます。
Arena には載っているが、まだ投票が集まっていない: Claude / Gemini / Qwen Chat / ChatGPT / Grok / ERNIE Bot (文心一言)