約1,030件を同じエージェント基盤で比較
| 分野 | 件数 | 内容 |
|---|---|---|
| SWE | 460 | 実リポジトリのバグ修正 |
| Terminal | 89 | セキュリティ、暗号、システム管理 |
| Algorithmic | 100 | 競技プログラミング |
| Multi-language | 225 | 6言語での実装 |
| Legal | 120 | 法律家が採点する課題 |
総合はほぼ互角、組み合わせると93%
SWEではKimi K3が92.4%、Fable 5が92.6%でした。しかし同じ失敗をするわけではないため、正解した安いモデルを課題ごとに選ぶと、全体の正答率が93%へ上がったとFireworks AIは報告しています。
93%と最大50倍は実運用ルーターの保証値ではありません。 オラクルルーティングは両モデルを実際に走らせ、正解したモデルのうち安い方を後から選ぶ理論上の上限です。本番ルーターは実行前に予測して選ぶため、誤振り分け、再試行、待ち時間、運用費を含めて検証する必要があります。
同点に見えても得意分野は違う
Kimi K3記号計算、開発ツール、セキュリティ・暗号を含む長時間ターミナル。
Fable 5ウェブ開発、データ可視化、Java・Python・C++を含む言語の幅。
補完関係89件のターミナルではK3だけの正解11件、Fableだけの正解7件。
最大50倍はどこから生まれたか
料金単価、プロンプトキャッシュ、タスクごとのターン数とトークン数が重なった結果です。SWEではKimi K3の方が長く処理しましたが、キャッシュにより費用を抑えました。ターミナルではFable 5が長くループし、時間切れまで進む例がありました。
Fireworks AIはKimi K3を提供する事業者です。比較条件、価格、キャッシュ仕様は同社基盤に依存します。第三者による再現、レイテンシ、品質分布、ルーター開発費を含めて判断します。
実験から直接は言えないこと
- 未知の仕事を実行前に93%正しく振り分けられるとは限らない。
- すべてのクラウド、契約、地域で50倍安くなるわけではない。
- 安いモデルほど常に速いわけではない。Kimi K3が多くのターンを使う分野もある。
- 機密性、データ所在地、ライセンス、保守費用は別に評価が必要。
確認した一次情報
よくある質問
93%は実際の自動ルーターの成績ですか?
いいえ。両モデルを走らせた後で安い正解を選ぶオラクルルーティングの結果です。
Kimi K3はFable 5より常に高性能ですか?
いいえ。総合は近く、Kimi K3はターミナルや記号処理、Fable 5はウェブや可視化などで強みが分かれました。
最大50倍はどの環境でも再現しますか?
Fireworks AI上の価格、キャッシュ、長時間エージェントループを含む特定条件の結果です。