


















今回はベンチマーク表を見るのではなく、https://cn.crazyrouter.com/v1 を使って実際に API テストを行いました。
使用したモデル:
claude-opus-4-7deepseek-v4-pro結論から言うと、DeepSeek V4 Pro はかなり強いです。ただし、プログラミング、JSON 出力、tool calling、本番環境での安定性を重視するなら、Claude Opus 4.7 の方がまだ安心して使えます。
テスト内容:
| テスト | Claude Opus 4.7 | DeepSeek V4 Pro |
|---|---|---|
| LRUCache hidden tests | ✅ Pass, 3.87s | ✅ Pass, 14.55s |
| retry bug fix | ✅ Pass, 3.44s | ❌ Fail, 20.74s |
| JSON object | ✅ Pass, 4.08s | ✅ Pass, 26.70s |
| unified diff patch | ✅ Pass, 3.75s | ✅ Pass, 23.37s |
| streaming | ✅ Pass, 1.99s | ✅ Pass, 1.80s |
スコア:
平均レイテンシ:
DeepSeek V4 Pro は弱いモデルではありません。
LRUCache、tool calling、streaming、diff patch は問題なく通りました。JSON も max_tokens を十分に取れば成功しました。
つまり、DeepSeek V4 Pro は以下の用途に向いています:
Claude Opus 4.7 は、とにかく安定していました。
コード生成が速く、出力が短く、構造化出力も扱いやすいです。
特に retry 関数のバグ修正では、Claude は一度で正しく修正しました。一方 DeepSeek V4 Pro はこのケースで reasoning tokens を使い切り、空の content を返しました。
本番環境では、これは大きな問題です。ユーザーは「モデルが考えていた」ことには興味がありません。必要なのは、使えるコードです。
おすすめは一つのモデルに固定することではなく、ルーティングです。
DeepSeek V4 Pro はかなり強く、実用レベルにあります。
しかし、コード生成と本番環境の信頼性では、Claude Opus 4.7 がまだ一歩上です。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。