現在確認できる主要数値
| 指標 | 最新確認値 | 読み方 |
|---|---|---|
| Intelligence Index | 50 | 同価格帯推論モデル中央値31を上回る |
| 出力速度 | 271.0 tokens/s | 出力開始後の生成速度 |
| TTFT | 12.72秒 | 最初のトークンまで。推論時間を含む |
| 入力料金 | 1.50ドル / 100万tokens | Google APIの掲載価格 |
| 出力料金 | 7.50ドル / 100万tokens | 入力より高いため長文出力に注意 |
| キャッシュヒット | 0.15ドル / 100万tokens | 通常入力から90%割引 |
| コンテキスト | 100万tokens | 長文入力に対応 |
記事の303.6と現在の271.0は両立し得る
速度値は固定ではありません。7月22日付の記事では毎秒303.6トークンと紹介されましたが、7月23日に確認したArtificial Analysisのモデルページは271.0トークン/秒を表示しています。プロバイダー、負荷、測定条件、集計更新で変わるため、利用時点の値を確認してください。
ベンチマークサイトは測定を継続し、モデルの提供経路や集計も更新します。記事化する時は測定日、推論設定、プロバイダーを残す必要があります。
指数50は同価格帯で強いが、最上位ではない
同価格帯の中央値31より高く、速度も大きな強みです。一方、複雑なエージェント、金融、コーディングでは上位モデルに届かない項目があります。価格差と失敗時の再試行を含めて評価します。
「自転車に乗るペリカン」は補助的な観察
SVG描画は視覚理解、空間配置、コード生成を一度に観察できる面白いテストです。しかし出力の揺れが大きく、古いモデルがうまく描く場合もあります。単一作品を総合性能ランキングには使えません。
AIベンチマーク確認の5項目
- 測定日とモデルの推論設定を確認する。
- 公式主張と第三者測定を分ける。
- tokens/sとTTFTを混同しない。
- 入力、出力、キャッシュ料金を分ける。
- 自社タスクで成功率と総費用を再測定する。