Kimi K3 / Fable 5 / Model routing

Kimi K3+Fable 5で93%、最大50倍のコスト効率とは?

1つのモデルへ全タスクを任せるより、安価なKimi K3と高性能なFable 5を使い分けた方が高品質・低コストになったというFireworks AIの実験を、数字の条件と限界まで整理します。

約1,030件を同じエージェント基盤で比較

分野件数内容
SWE460実リポジトリのバグ修正
Terminal89セキュリティ、暗号、システム管理
Algorithmic100競技プログラミング
Multi-language2256言語での実装
Legal120法律家が採点する課題

総合はほぼ互角、組み合わせると93%

SWEではKimi K3が92.4%、Fable 5が92.6%でした。しかし同じ失敗をするわけではないため、正解した安いモデルを課題ごとに選ぶと、全体の正答率が93%へ上がったとFireworks AIは報告しています。

93%と最大50倍は実運用ルーターの保証値ではありません。 オラクルルーティングは両モデルを実際に走らせ、正解したモデルのうち安い方を後から選ぶ理論上の上限です。本番ルーターは実行前に予測して選ぶため、誤振り分け、再試行、待ち時間、運用費を含めて検証する必要があります。

同点に見えても得意分野は違う

Kimi K3記号計算、開発ツール、セキュリティ・暗号を含む長時間ターミナル。
Fable 5ウェブ開発、データ可視化、Java・Python・C++を含む言語の幅。
補完関係89件のターミナルではK3だけの正解11件、Fableだけの正解7件。

最大50倍はどこから生まれたか

料金単価、プロンプトキャッシュ、タスクごとのターン数とトークン数が重なった結果です。SWEではKimi K3の方が長く処理しましたが、キャッシュにより費用を抑えました。ターミナルではFable 5が長くループし、時間切れまで進む例がありました。

Fireworks AIはKimi K3を提供する事業者です。比較条件、価格、キャッシュ仕様は同社基盤に依存します。第三者による再現、レイテンシ、品質分布、ルーター開発費を含めて判断します。

実験から直接は言えないこと

  • 未知の仕事を実行前に93%正しく振り分けられるとは限らない。
  • すべてのクラウド、契約、地域で50倍安くなるわけではない。
  • 安いモデルほど常に速いわけではない。Kimi K3が多くのターンを使う分野もある。
  • 機密性、データ所在地、ライセンス、保守費用は別に評価が必要。

確認した一次情報

よくある質問

93%は実際の自動ルーターの成績ですか?

いいえ。両モデルを走らせた後で安い正解を選ぶオラクルルーティングの結果です。

Kimi K3はFable 5より常に高性能ですか?

いいえ。総合は近く、Kimi K3はターミナルや記号処理、Fable 5はウェブや可視化などで強みが分かれました。

最大50倍はどの環境でも再現しますか?

Fireworks AI上の価格、キャッシュ、長時間エージェントループを含む特定条件の結果です。