惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
Security @ Cisco Blogs
罗磊的独立博客
宝玉的分享
宝玉的分享
Last Week in AI
Last Week in AI
T
The Blog of Author Tim Ferriss
美团技术团队
T
Tailwind CSS Blog
博客园 - 三生石上(FineUI控件)
博客园 - Franky
G
Google Developers Blog
Jina AI
Jina AI
Stack Overflow Blog
Stack Overflow Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
V
Visual Studio Blog
腾讯CDC
S
SegmentFault 最新的问题
Recent Announcements
Recent Announcements
博客园 - 叶小钗
Microsoft Security Blog
Microsoft Security Blog
雷峰网
雷峰网
L
LangChain Blog
Vercel News
Vercel News
Forbes - Security
Forbes - Security
PCI Perspectives
PCI Perspectives
N
News | PayPal Newsroom
S
Security Affairs
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
博客园 - 司徒正美
J
Java Code Geeks
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Hacker News: Ask HN
Hacker News: Ask HN
Schneier on Security
Schneier on Security
A
About on SuperTechFans
Attack and Defense Labs
Attack and Defense Labs
Google Online Security Blog
Google Online Security Blog
aimingoo的专栏
aimingoo的专栏
MongoDB | Blog
MongoDB | Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
酷 壳 – CoolShell
酷 壳 – CoolShell
Cloudbric
Cloudbric
B
Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
P
Proofpoint News Feed
D
DataBreaches.Net
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
B
Blog RSS Feed
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
N
News and Events Feed by Topic

Crazyrouter Blog

Gemini CLI Complete Guide 2026: Repo Automation, CI Agents, and Multi-Model Routing Ideogram AI Guide 2026: Brand Design Automation, API Workflows, and Alternatives GLM 4.6 API Guide 2026: Agents, RAG, Tool Calling, and Bilingual Apps WAN 2.2 Animate Tutorial 2026: Character Consistency, Shot Control, and API Workflows Google Veo3 API Guide 2026: Production Video Pipelines, Prompts, Pricing, and Fallbacks AI API Pricing Comparison 2026: Text, Image, Video, Caching, and Router Costs Codex CLI Installation Guide 2026: Windows, macOS, Linux, Proxies, and CI Setup How to Get a Claude API Key in 2026: Secure Setup for Teams, CI, and Alternatives Gemini Advanced Review 2026: Is It Worth It for Coding, Research, and API Teams? Claude Code Pricing Guide 2026: Team Agent Budgets, API Fallbacks, and Cost Control Seedance 2.0 Pricing: Convert 46 CNY per Million Tokens to Cost per Second Seedance 2.0 计费详解:46元/百万Token换算成每秒多少钱 Seedance 2.0料金解説:100万Tokenあたり46元を1秒あたりコストに換算 Gemini CLI 使用教程 2026:安装、代码示例、代理环境与 API 接入 Gemini 是什么?2026 完整介绍、API 使用教程与价格对比 Qwen2.5-Omni Guide 2026: Real-Time Voice, Vision, and Multimodal Agents Kimi K2 Thinking Guide 2026: Reasoning Workflows, Evals, and Cost Control Google Veo3 API Guide 2026: Batch Video Pipelines, Pricing, and Fallbacks Codex CLI Installation Guide 2026: macOS, Linux, WSL, Proxies, and Dev Containers How to Get a Claude API Key in 2026: Safe Production Setup and Alternatives AI API Pricing Comparison 2026: GPT, Claude, Gemini, Video, and Agent Workloads Gemini Advanced Review 2026: Is It Worth It for Developer Teams? Claude Code Pricing Guide 2026: API Fallbacks, Team Seats, and Budget Control Seedream 4.0 API Tutorial 2026: Batch Image Generation, Product Creative, and Pricing Qwen2.5-Omni Guide 2026: Real-Time Voice, Vision, Text Agents, and API Integration Kimi K2 Thinking Guide 2026: Reasoning Agents, Evaluation Workflows, and API Cost Control WAN 2.2 Animate Tutorial 2026: Character Motion, Shot Control, API Pipelines, and Pricing Google Veo3 API Guide 2026: Production Video Workflows, Prompts, Pricing, and Fallbacks AI API Pricing Comparison 2026: OpenAI, Claude, Gemini, DeepSeek, and Router Costs How to Get a Claude API Key in 2026: Setup, Security, Rotation, and Alternatives Codex CLI Installation Guide 2026: macOS, Linux, WSL, Proxies, and Devcontainers Gemini Advanced Review 2026: Is It Worth It for Developers and API Builders? Claude Code Pricing Guide 2026: CI Agents, Team Seats, and API Budget Planning 一個 API Key 呼叫 GPT、Claude、Gemini:5 分鐘設定教學 AI API Gateway for Singapore and Malaysia Developers: One Endpoint for GPT, Claude and Gemini AI API Gateway for Thai Developers: Use GPT, Claude and Gemini with One Key Cómo usar GPT, Claude y Gemini con una sola API key One API Key for GPT, Claude and Gemini: A Practical Setup for Central Asia Developers Gemini 3.5 Flash vs Claude レスポンスティアモデル:開発者はどちらを選ぶべきか Gemini 3.5 Flash vs Claude Response-Tier Models: Какую модель выбрать разработчику? Gemini 3.5 Flash vs Claude Response-Tier Models: Which One Should Developers Use? Gemini 3.5 Flash vs Gemini 3 Flash vs Gemini 2.5 Flash: Real API Benchmark text-embedding-3-large 值不值得用?和 text-embedding-3-small 的成本、效果与选型对比 用 text-embedding-3-large 搭建 RAG 知识库:从切块、向量化到检索排序 text-embedding-3-large 是干什么的?Embedding 模型入门与 RAG 场景详解 AI 扩图 API 指南 2026:Uncrop、Outpaint、gpt-image-2 和 Nano Banana 路线怎么选 How to Test Multiple AI Image Models with One API Key "How to Test Multiple AI Image Models with One API Key" Codex CLI Installation Guide: Setup on macOS, Linux, Windows WSL and CI/CD Gemini CLI 使用教程:开发者终端 AI 助手完全指南 Grok 4 免费使用教程:合法体验路径、API 接入与替代方案 Seedream 4.0 API Tutorial: ByteDance Image Generation for Production Pipelines Kimi K2 Thinking Model: Complete Developer Guide for Reasoning Workflows Luma Ray 2 Review: AI Video Generation Quality, Speed, and API Guide Pika 2.2 New Features Review: Scene Director, Sound Design, and API Updates Google Veo 3 API Guide: Video Generation with Audio for Developers AI Lip Sync Tools Comparison 2026: Best APIs for Talking Avatars and Video Dubbing Gemini Advanced Review May 2026: Is It Worth $20/Month for AI Power Users? Claude Code Pricing in May 2026: Max Plan, Opus 4, and Real Cost Breakdown Hermes Agent + Crazyrouter: One-Click Setup for 627+ AI Models Text-Embedding-3-Small: Complete Guide to OpenAI's Most Popular Embedding Model (2026) Cursor 配置 Crazyrouter 教程:国内用上 GPT-5.4 / Claude 写代码 2026 年国内如何调用 Claude API?Claude Opus / Sonnet 接入完全指南 2026 年国内如何调用 GPT-5.4 API?完整接入指南(含代码示例) AI API 常见报错排查大全:401、429、500、timeout 一篇搞定 2026 年 AI API 中转站哪家好?六大平台横向对比评测 2026 年 DeepSeek R1 API 接入指南:国内最强推理模型怎么调用 Trình Tạo Meme & Sách Tô Màu Bằng AI Với GPT-image-2 — Những Dự Án Vui Mà Vẫn Kiếm Ra Tiền Dự Đoán Em Bé Tương Lai Bằng AI Với GPT-image-2 — Xem Con Bạn Có Thể Trông Như Thế Nào Chuyển Đổi Ảnh Sang Phong Cách Ghibli Với GPT-image-2 — Biến Mọi Bức Ảnh Thành Tranh Anime Tạo Mô Hình Nhân Vật Hành Động Bằng AI Với GPT-image-2 — Biến Bất Kỳ Ai Thành Đồ Chơi Trong Hộp GPT-image-2: Nhận Diện Khuôn Mặt Và Phân Tích Màu Sắc Bằng AI Xem chỉ tay với GPT-image-2 — Tạo bản phân tích chỉ tay chuyên nghiệp chỉ từ một bức ảnh GPT-image-2로 AI 밈 생성기 & 컬러링북 만들기 — 재미있고 수익도 되는 프로젝트 GPT-image-2로 AI 미래 아기 예측 — 우리 아이는 어떤 모습일까? GPT-image-2로 지브리 스타일 변환 — 사진을 애니메이션 아트로 바꾸기 GPT-image-2로 AI 액션 피규어 생성하기 — 누구나 박스형 피규어로 바꾸는 법 GPT-image-2로 AI 관상 분석 & 퍼스널 컬러 진단 — 두 가지 바이럴 활용법 완벽 가이드 GPT-image-2 실전 가이드:AI 손금 분석 — 손바닥 사진 한 장으로 전문 손금 인포그래픽 생성하기 GPT-image-2 で AI ミーム生成 & ぬりえブック制作 — 楽しくて本当に稼げるプロジェクト GPT-image-2 で AI 未来の赤ちゃん予測 — 将来の子どもの顔を見てみよう GPT-image-2 でジブリ風写真変換 — どんな写真もアニメアートに GPT-image-2 で AI アクションフィギュア生成 — 誰でもボックス入りおもちゃに変身 GPT-image-2 で AI 顔相診断 & パーソナルカラー分析 — 2つのバズ活用法を1本で解説 GPT-image-2 で AI 手相占い — 1枚の写真からプロ仕様の手相分析を生成 GPT-image-2 на практике: AI-генератор мемов и раскрасок — весёлые проекты, которые приносят деньги GPT-image-2 на практике: AI-предсказание будущего ребёнка — как будет выглядеть ваш малыш GPT-image-2 на практике: стиль Гибли — превратите любое фото в аниме-арт GPT-image-2 на практике: AI-генератор фигурок — превратите себя в коллекционную игрушку GPT-image-2 на практике: AI-физиогномика и анализ цветотипа — два вирусных кейса в одном гайде GPT-image-2 на практике: AI-хиромантия — генерация профессионального анализа ладони по фото GPT-image-2 实战:AI Meme 生成器 & 涂色书制作 — 好玩还能赚钱的两个项目 GPT-image-2 实战:AI 预测未来宝宝 — 看看你们的孩子长什么样 GPT-image-2 实战:吉卜力风格转换 — 把任何照片变成宫崎骏动画 GPT-image-2 实战:AI 手办生成器 — 把任何人变成盒装公仔 GPT-image-2 实战:AI 面相分析 & 个人色彩诊断 — 两大爆款玩法一文搞定 GPT-image-2 实战:AI 看手相 — 一张手掌照片生成专业手相分析图 AI Meme Generator & Coloring Book Creator with GPT-image-2 — Fun Projects That Actually Make Money AI Future Baby Prediction with GPT-image-2 — See What Your Child Might Look Like Ghibli Style Photo Transformation with GPT-image-2 — Turn Any Photo Into Anime Art
Gemini 3.5 Flash vs Gemini 3 Flash vs Gemini 2.5 Flash:実運用APIベンチマーク
Crazyrouter Team · 2026-05-21 · via Crazyrouter Blog

Gemini 3.5 Flash vs Gemini 3 Flash vs Gemini 2.5 Flash:実運用APIベンチマーク#

GoogleのFlashモデルシリーズは、同じ約束を掲げています:高い品質、低レイテンシ、Proモデルより優れたコスト管理。

しかし2026年のFlashラインアップは選択肢が増えました。AIプロダクトを構築する際、実務的には少なくとも3つの選択肢が考えられます:

  • gemini-3.5-flash
  • gemini-3-flash
  • gemini-2.5-flash

名前は似ていますが、実際の動作は異なります。

同じOpenAI互換APIエンドポイント経由で、3つのモデルをテストしました:

目的はシンプルです:モデル名だけでなく、実際のAPI動作を比較すること。同じプロンプトを使用して、レイテンシ、回答品質、コーディング・デバッグ能力、推論の信頼性を測定しました。

Gemini 3.5 Flash vs Gemini 3 Flash vs Gemini 2.5 Flash のベンチマーク比較

判定:どのGemini Flashモデルを選ぶべきか#

結論だけが必要な場合:

ユースケース最適な選択理由
最低レイテンシgemini-3.5-flashこのテストで最速の平均レイテンシ
全タスク通じた安定性gemini-3-flashテストセット内の全タスク成功
レガシー互換性 / 既存環境gemini-2.5-flash実用的だが推論能力は劣る
コーディング・デバッグ同等3つとも同じPythonバグを修正
複数ステップの推論gemini-3.5-flash または gemini-3-flashスケジューリング問題を解決;2.5は2回截断
バッチ要約 / 低リスクテキスト処理いずれでも可全て動作;新しいモデルが出力がクリーン

実務的な推奨:

  • 最新のFlashモデルと低レイテンシを求める場合gemini-3.5-flashから開始
  • 安定した出力フォーマットとタスク成功率を重視する場合gemini-3-flashをデフォルトに
  • 既に本番環境で運用中、または過去の動作と比較が必要な場合gemini-2.5-flashを継続

複数モデルの併用戦略:日本国内のスタートアップや開発チームでは、単一モデルに固定するより、タスク種別ごとにモデルをルーティングする方が、予測可能なコスト管理と安定性の両立が実現しやすいです。OpenAI/Claude/Geminiを直接呼び出す場合と異なり、APIゲートウェイ経由なら同じコード内で複数モデルを切り替えられ、本番環境での段階的な移行が容易になります。

テスト内容#

開発者の実務的なワークロードを反映した4つのタスクを使用しました:

  1. 要約タスク — フォーマット規則に従い、正確に5つの箇条書きを生成
  2. 制約付き推論 — 2人の作業者のスケジューリング問題を解決
  3. コーディング・デバッグ — PythonのtopK関数を修正
  4. 数学推論 — 月次トークンコスト削減額を計算

各モデルは各タスクを2回実行しました。

テストは意図的に小規模です。学術的な完全ベンチマークではありません。しかし、同じエンドポイント、同じプロンプト、同じクライアントコードで、実際のAPI呼び出しにおけるモデルの動作を示すため、実用的な価値があります。

テスト環境#

項目
テスト日時2026-05-21 UTC
エンドポイントhttps://cn.crazyrouter.com/v1/chat/completions
APIフォーマットOpenAI互換 Chat Completions
モデルgemini-3.5-flash, gemini-3-flash, gemini-2.5-flash
実行回数モデルあたり4タスク × 2回
Temperature推論・コーディングタスク:0
Max tokens最終ベンチマーク実行時:1024
クライアントPython requests

モデル検出の確認として、以下のエンドポイントから3つのモデルIDが利用可能であることを確認しました:

モデルリストは3つのターゲットIDをすべて返しました:

ベンチマーク結果#

2回目のベンチマーク実行の最終結果です。

モデル平均レイテンシ中央値レイテンシ最速実行最遅実行平均品質スコア平均出力サイズ
gemini-3.5-flash4.99s5.10s3.69s5.97s0.875520文字
gemini-3-flash7.80s4.85s3.81s29.79s1.000508文字
gemini-2.5-flash7.52s5.15s3.56s17.55s0.713300文字

品質スコアはテストハーネスからのシンプルなタスクレベルの成功/失敗スコアです。スコア1.0はモデルがタスクを正確に実行したことを意味します。部分スコアはモデルが接近したが完璧ではなかったことを示します。

Gemini Flash レイテンシ比較チャート

結果1:Gemini 3.5 Flashが最良の平均レイテンシを達成#

gemini-3.5-flashがこのテストで最低の平均レイテンシを記録しました:

差異は主に他の2つのモデルのレイテンシスパイクが原因でした:

  • gemini-3-flashは1回のテストで29.79秒の遅延
  • gemini-2.5-flashは1回のテストで17.55秒の遅延
  • gemini-3.5-flash3.69秒~5.97秒の範囲内に収まった

これはgemini-3.5-flashが常に高速であることを証明するものではありません。APIレイテンシはルーティング、負荷、地域、プロンプト長、上流の可用性に依存します。

しかし、このテストでは最も一貫性がありました。

推論能力の比較#

推論タスクはスケジューリング問題でした:

タスクAは2分かかり、Cが開始する前に終了する必要があります。タスクBは3分かかり、いつでも実行できます。タスクCは4分かかります。2人の同一の作業者がいます。最小総時間は?

正解:6分

最適なスケジュール:

  • 作業者1:A(0~2分)、その後C(2~6分)
  • 作業者2:B(0~3分)
  • 総時間:6分
モデル結果備考
gemini-3.5-flash成功正確な最終回答と明確なスケジュール
gemini-3-flash成功正確な最終回答、ただし1回は遅延
gemini-2.5-flash失敗(このセットアップ)両回とも完全な回答前にfinish_reason: lengthで終了

これはテスト内で最も明確な差異でした。

gemini-2.5-flashは異なる設定で問題を解決できる可能性がありますが、同じベンチマーク条件下では推論タスクで截断されました。新しいFlashモデルはより良く対応しました。

Gemini Flash 推論・コーディングテスト概要

コーディング能力の比較#

コーディングタスクはシンプルながら実用的でした。各モデルに以下の不完全なPython関数を提供しました:

この関数は最高スコアのk個のアイテムを最初に返すべきです。

正しい修正:

3つのモデルすべてがこのタスクに成功しました。

モデルコーディング結果コメント
gemini-3.5-flash成功明確な説明、正確なreverse=True修正
gemini-3-flash成功正確なコードとやや長い説明
gemini-2.5-flash成功正確かつ簡潔

小規模なデバッグタスクでは、差異は大きくありませんでした。3つのモデルいずれも基本的なコード修復を処理できます。

より大きな差異は、コード、長いコンテキスト、ツール使用、複数ステップの推論を組み合わせたタスクで現れます。

数学・コスト推論の比較#

トークンコスト計算もテストしました:

  • 日次入力:120万トークン
  • 日次出力:18万トークン
  • モデルX:入力0.50/100万、出力0.50/100万、出力3.00/100万
  • モデルY:入力0.30/100万、出力0.30/100万、出力2.50/100万
  • 期間:30日

正確な計算:

すべての完全な回答は**$9.90**を返しました。

1つのgemini-3.5-flash実行はfinish_reason: lengthで目に見えるコンテンツを返さなかったため、その実行を失敗とカウントしました。これが最終テーブルでそのスコアがgemini-3-flashより低い理由です。

これは重要な思い出させです:品質は知能だけではありません。出力制御、トークン設定、終了理由が本番環境で重要です。

APIテストコード#

ベンチマークに使用した簡略化されたPythonコードです。

gemini-3.5-flashの出力例:

gemini-3-flashの出力例:

コスト・価格に関する注記#

Flashモデルは品質・速度・コストのトライアングルの中間に位置するため、選択されることが多いです。

公開価格ページとサードパーティ比較ページは急速に変わる可能性があります。内部価格ノートでは、gemini-3-flashは約入力0.50/100万トークン∗∗、∗∗出力0.50/100万トークン**、**出力3.00/100万トークンgemini-2.5-flashは約入力0.30/100万トークン∗∗、∗∗出力0.30/100万トークン**、**出力2.50/100万トークンと記載されています。

gemini-3.5-flashのような新しいモデルについては、本番運用前に現在のモデル価格を必ず確認してください。

Crazyrouter経由で使用する場合、1つのOpenAI互換APIキーでモデルの可用性を確認し、複数モデルをルーティングできます。本番ワークロードでは、アプリケーションを書き直さずにモデル切り替えをテストできるため有用です。

関連リンク:

外部参考資料:

本番環境での推奨事項#

ほとんどのチームにとって、1つのGemini Flashモデルを永遠に選ぶことは推奨しません。

タスク種別ごとにルーティングすることをお勧めします:

タスク種別推奨ルート
ユーザー向けの高速チャットgemini-3.5-flashから開始
安定したデフォルトアシスタント動作gemini-3-flashを使用
既に2.5用にチューニングされたレガシーワークロードgemini-2.5-flashを継続、ただし移行をテスト
シンプルな要約フォーマットに従う最も安いモデルを使用
コーディング・デバッグgemini-3.5-flashgemini-3-flashの両方をテスト
複数ステップの推論新しいFlashモデルを優先;截断と終了理由を監視

重要なパターンは、1つのモデルを永遠にハードコーディングしないことです。

モデル選択をルーティングレイヤーの背後に配置してください。レイテンシ、コスト、エラー率、終了理由、ユーザー結果を追跡します。その後、そのタスクに最良の結果をもたらすモデルを選択します。

ここがAPIゲートウェイが役立つ場所です。同じクライアントコード、同じベースURL、同じリクエストフォーマットを保ちながら、異なるモデルIDをテストできます。

最終的な結論#

gemini-3.5-flashは、最新のFlashモデルと強いレイテンシ性能を求める場合、最初の選択肢として見えます。

gemini-3-flashはこの小規模テストで最も信頼性の高いモデルでした。すべてのタスクに成功しましたが、1回の大きなレイテンシスパイクがありました。

gemini-2.5-flashは依然として有用です、特に古い展開の場合、しかし同じベンチマーク設定下では推論動作がより弱かったです。

本番環境では、最も安全な答えは「1つのモデルを選ぶ」ではありません。

より安全な答えは:

最新のFlashモデルをプライマリルートとして使用し、別のFlashモデルをフォールバックとして保ち、実際のAPIトラフィックを通じて実際のタスク結果を測定してください。

FAQ#

gemini-3.5-flashはgemini-3-flashより優れていますか?#

テストでは、gemini-3.5-flashはより良い平均レイテンシを持ち、gemini-3-flashは最高のタスク成功スコアを持っていました。速度を重視する場合は3.5 Flashから開始してください。保守的な安定性を重視する場合は、3 Flashもテストしてください。

gemini-3.5-flashはgemini-2.5-flashより高速ですか?#

このベンチマークではそうです。gemini-3.5-flashは平均4.99秒、gemini-2.5-flashは平均7.52秒でした。サンプルサイズが小さいため、実際のプロンプトで独自のテストを実行すべきです。

コーディングに最適なGemini Flashモデルはどれですか?#

3つのモデルすべてが単純なPythonバグを修正しました。より複雑なコーディングタスクの場合、gemini-3.5-flashgemini-3-flashを最初にテストし、出力品質、再試行、レイテンシを比較することをお勧めします。

gemini-2.5-flashが推論テストに失敗したのはなぜですか?#

両方の推論実行で完全な回答前にfinish_reason: lengthを返しました。これはモデル動作、トークン予算、またはルーティング設定が原因である可能性があります。本番環境では、HTTPの成功だけでなく、常に終了理由を監視してください。

これらのGeminiモデルをOpenAI SDKで呼び出せますか?#

はい。OpenAI互換ゲートウェイ経由で、modelフィールドを変更することで、これらのモデルを/v1/chat/completionsで呼び出せます。この記事でテストされたエンドポイントはhttps://cn.crazyrouter.com/v1でした。