























Я протестировал Claude Opus 4.7 и DeepSeek V4 Pro через OpenAI-compatible API Crazyrouter:
Главный вывод:
DeepSeek V4 Pro уже очень сильный модельный вариант. Но для программирования, стабильного JSON, tool calling и production-workflow Claude Opus 4.7 остаётся более надёжным выбором.
Я проверял не синтетический leaderboard, а практические сценарии для разработчиков:
| Тест | Claude Opus 4.7 | DeepSeek V4 Pro |
|---|---|---|
| LRUCache hidden tests | Pass, 3.87s | Pass, 14.55s |
| Retry bug fix | Pass, 3.44s | Fail, 20.74s |
| JSON object | Pass, 4.08s | Pass, 26.70s |
| Unified diff patch | Pass, 3.75s | Pass, 23.37s |
| Streaming | Pass, 1.99s | Pass, 1.80s |
Итоговый счёт:
Средняя задержка:
DeepSeek V4 Pro не слабый. Он прошёл LRUCache, tool calling, streaming, diff patch и JSON при достаточном max_tokens.
Это хороший кандидат для:
Claude Opus 4.7 был стабильнее и предсказуемее.
В тесте на исправление retry-функции Claude сразу выдал корректный код. DeepSeek V4 Pro в этом прогоне потратил budget на reasoning и вернул пустой output:
Для production это важнее, чем кажется. Пользователю не важно, насколько долго модель думала. Важно получить рабочий код.
Лучший подход — не выбирать одну модель навсегда, а маршрутизировать задачи:
DeepSeek V4 Pro уже достаточно силён, чтобы быть частью production model pool.
Но для программирования, структурированного вывода и надёжности в production Claude Opus 4.7 всё ещё сильнее как default coding model.
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。