汎用エージェント

ツリー全体0 票

指示を出すと調査・予約・ファイル操作などを自律的にこなす「おまかせ型」エージェントの比較です。Computer use や自律実行の実用度を、実際に試したユーザーの評価で確認できます。

まだ投票がありません。最初の投票者になりましょう。

評価基準

tier はあくまで投票者個人の主観的な評価で大丈夫です。以下は投票時の目安です。

  • S

    おすすめストレスなくタスクを実行可能。少ないプロンプト・ラリーで意図したモノを生成できる。コストパフォーマンスに優れる。ハルシネーションがほとんどない。

  • A

    良い熟練者であればほとんどのタスクを実行可能。最終的に意図したモノを生成できる。コストパフォーマンスは良い。ハルシネーションが少ない。

  • B

    普通多くのプロンプト・ラリーによって意図したモノを生成できる。コストパフォーマンスは普通。エラーやハルシネーションが起きる。

  • C

    やや問題ありどんなにラリーを重ねても意図したモノを生成できない可能性がやや高い。エラーやハルシネーションが多い。

  • ほぼ不可能ほとんどの場合で意図したモノを生成できない。

Arena ベンチマークと比べる

arena.ai (旧 LMArena)のブラインド対戦 Elo を tier に換算した参考値です arena.ai データ: LMArena Leaderboard Dataset (CC BY 4.0)

この tier 表の読み方 (Arena とは?)

Arena (旧 LMArena)は、2 つの AI の回答を名前を伏せて見比べて良い方を選ぶ投票サイトです。世界中の投票がチェスと同じ Elo レーティングに集計されます。

トップとの Elo 差で tier にしています: 20 以内 = S、35 以内 = A、60 以内 = B、それより下 = C。

エージェントだけはスコアが「改善率」 (タスクをどれだけ良くしたか。悪化はマイナス)で、トップとの差 2 ポイント以内 = S、3.5000000000000004 以内 = A、6 以内 = B です。ロゴは提供元の代表的な製品に便宜的に対応付けています。

サービス表示では、同じサービスのモデルのうち最高スコアのものを代表にしています。

エージェント2026-08-19 時点 上位 25 件を表示 (全 50 モデル)

みんなの投票とのズレ

みんなの投票と共通のサービスがまだありません。投票が集まると比較が表示されます。

Arena には載っているが、まだ投票が集まっていない: Claude Code / Kimi / Codex / DeepSeek / Qwen Chat / Grok

外部ベンチマーク総合 (参考)

論文・レビューサイト・メディア実測の評価を tier に換算して平均した参考値です (2026-07-14 時点)

各ソースの評価を S=4〜C=1 に換算した単純平均。ソースが 1 件だけの tier は参考程度に見てください (かっこ内はソース数)。

ソース:GAIA 集計OpenAI(ChatGPT agent)G2AllAboutAI 実測

コメント