惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

H
Hackread – Cybersecurity News, Data Breaches, AI and More
博客园 - 三生石上(FineUI控件)
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
B
Blog
D
DataBreaches.Net
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
V
Vulnerabilities – Threatpost
Jina AI
Jina AI
T
Threat Research - Cisco Blogs
The Hacker News
The Hacker News
Latest news
Latest news
博客园_首页
T
Tenable Blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
酷 壳 – CoolShell
酷 壳 – CoolShell
Apple Machine Learning Research
Apple Machine Learning Research
Spread Privacy
Spread Privacy
Martin Fowler
Martin Fowler
Y
Y Combinator Blog
P
Privacy & Cybersecurity Law Blog
C
Cisco Blogs
I
InfoQ
The Cloudflare Blog
J
Java Code Geeks
C
Cybersecurity and Infrastructure Security Agency CISA
量子位
P
Proofpoint News Feed
C
Cyber Attacks, Cyber Crime and Cyber Security
Last Week in AI
Last Week in AI
T
Tailwind CSS Blog
AWS News Blog
AWS News Blog
Stack Overflow Blog
Stack Overflow Blog
Hugging Face - Blog
Hugging Face - Blog
The Register - Security
The Register - Security
M
MIT News - Artificial intelligence
G
Google Developers Blog
Simon Willison's Weblog
Simon Willison's Weblog
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
T
The Exploit Database - CXSecurity.com
A
Arctic Wolf
D
Darknet – Hacking Tools, Hacker News & Cyber Security
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
V
Visual Studio Blog
Project Zero
Project Zero
P
Privacy International News Feed
Engineering at Meta
Engineering at Meta
G
GRAHAM CLULEY
博客园 - Franky
C
CERT Recently Published Vulnerability Notes

Crazyrouter Blog

Gemini CLI Complete Guide 2026: Repo Automation, CI Agents, and Multi-Model Routing Ideogram AI Guide 2026: Brand Design Automation, API Workflows, and Alternatives GLM 4.6 API Guide 2026: Agents, RAG, Tool Calling, and Bilingual Apps WAN 2.2 Animate Tutorial 2026: Character Consistency, Shot Control, and API Workflows Google Veo3 API Guide 2026: Production Video Pipelines, Prompts, Pricing, and Fallbacks AI API Pricing Comparison 2026: Text, Image, Video, Caching, and Router Costs Codex CLI Installation Guide 2026: Windows, macOS, Linux, Proxies, and CI Setup How to Get a Claude API Key in 2026: Secure Setup for Teams, CI, and Alternatives Gemini Advanced Review 2026: Is It Worth It for Coding, Research, and API Teams? Claude Code Pricing Guide 2026: Team Agent Budgets, API Fallbacks, and Cost Control Seedance 2.0 Pricing: Convert 46 CNY per Million Tokens to Cost per Second Seedance 2.0 计费详解:46元/百万Token换算成每秒多少钱 Seedance 2.0料金解説:100万Tokenあたり46元を1秒あたりコストに換算 Gemini CLI 使用教程 2026:安装、代码示例、代理环境与 API 接入 Gemini 是什么?2026 完整介绍、API 使用教程与价格对比 Qwen2.5-Omni Guide 2026: Real-Time Voice, Vision, and Multimodal Agents Kimi K2 Thinking Guide 2026: Reasoning Workflows, Evals, and Cost Control Google Veo3 API Guide 2026: Batch Video Pipelines, Pricing, and Fallbacks Codex CLI Installation Guide 2026: macOS, Linux, WSL, Proxies, and Dev Containers How to Get a Claude API Key in 2026: Safe Production Setup and Alternatives AI API Pricing Comparison 2026: GPT, Claude, Gemini, Video, and Agent Workloads Gemini Advanced Review 2026: Is It Worth It for Developer Teams? Claude Code Pricing Guide 2026: API Fallbacks, Team Seats, and Budget Control Seedream 4.0 API Tutorial 2026: Batch Image Generation, Product Creative, and Pricing Qwen2.5-Omni Guide 2026: Real-Time Voice, Vision, Text Agents, and API Integration Kimi K2 Thinking Guide 2026: Reasoning Agents, Evaluation Workflows, and API Cost Control WAN 2.2 Animate Tutorial 2026: Character Motion, Shot Control, API Pipelines, and Pricing Google Veo3 API Guide 2026: Production Video Workflows, Prompts, Pricing, and Fallbacks AI API Pricing Comparison 2026: OpenAI, Claude, Gemini, DeepSeek, and Router Costs How to Get a Claude API Key in 2026: Setup, Security, Rotation, and Alternatives Codex CLI Installation Guide 2026: macOS, Linux, WSL, Proxies, and Devcontainers Gemini Advanced Review 2026: Is It Worth It for Developers and API Builders? Claude Code Pricing Guide 2026: CI Agents, Team Seats, and API Budget Planning 一個 API Key 呼叫 GPT、Claude、Gemini:5 分鐘設定教學 AI API Gateway for Singapore and Malaysia Developers: One Endpoint for GPT, Claude and Gemini AI API Gateway for Thai Developers: Use GPT, Claude and Gemini with One Key Cómo usar GPT, Claude y Gemini con una sola API key One API Key for GPT, Claude and Gemini: A Practical Setup for Central Asia Developers Gemini 3.5 Flash vs Claude レスポンスティアモデル:開発者はどちらを選ぶべきか Gemini 3.5 Flash vs Claude Response-Tier Models: Какую модель выбрать разработчику? Gemini 3.5 Flash vs Claude Response-Tier Models: Which One Should Developers Use? Gemini 3.5 Flash vs Gemini 3 Flash vs Gemini 2.5 Flash:実運用APIベンチマーク Gemini 3.5 Flash vs Gemini 3 Flash vs Gemini 2.5 Flash: Real API Benchmark 用 text-embedding-3-large 搭建 RAG 知识库:从切块、向量化到检索排序 text-embedding-3-large 是干什么的?Embedding 模型入门与 RAG 场景详解 AI 扩图 API 指南 2026:Uncrop、Outpaint、gpt-image-2 和 Nano Banana 路线怎么选 How to Test Multiple AI Image Models with One API Key "How to Test Multiple AI Image Models with One API Key" Codex CLI Installation Guide: Setup on macOS, Linux, Windows WSL and CI/CD Gemini CLI 使用教程:开发者终端 AI 助手完全指南 Grok 4 免费使用教程:合法体验路径、API 接入与替代方案 Seedream 4.0 API Tutorial: ByteDance Image Generation for Production Pipelines Kimi K2 Thinking Model: Complete Developer Guide for Reasoning Workflows Luma Ray 2 Review: AI Video Generation Quality, Speed, and API Guide Pika 2.2 New Features Review: Scene Director, Sound Design, and API Updates Google Veo 3 API Guide: Video Generation with Audio for Developers AI Lip Sync Tools Comparison 2026: Best APIs for Talking Avatars and Video Dubbing Gemini Advanced Review May 2026: Is It Worth $20/Month for AI Power Users? Claude Code Pricing in May 2026: Max Plan, Opus 4, and Real Cost Breakdown Hermes Agent + Crazyrouter: One-Click Setup for 627+ AI Models Text-Embedding-3-Small: Complete Guide to OpenAI's Most Popular Embedding Model (2026) Cursor 配置 Crazyrouter 教程:国内用上 GPT-5.4 / Claude 写代码 2026 年国内如何调用 Claude API?Claude Opus / Sonnet 接入完全指南 2026 年国内如何调用 GPT-5.4 API?完整接入指南(含代码示例) AI API 常见报错排查大全:401、429、500、timeout 一篇搞定 2026 年 AI API 中转站哪家好?六大平台横向对比评测 2026 年 DeepSeek R1 API 接入指南:国内最强推理模型怎么调用 Trình Tạo Meme & Sách Tô Màu Bằng AI Với GPT-image-2 — Những Dự Án Vui Mà Vẫn Kiếm Ra Tiền Dự Đoán Em Bé Tương Lai Bằng AI Với GPT-image-2 — Xem Con Bạn Có Thể Trông Như Thế Nào Chuyển Đổi Ảnh Sang Phong Cách Ghibli Với GPT-image-2 — Biến Mọi Bức Ảnh Thành Tranh Anime Tạo Mô Hình Nhân Vật Hành Động Bằng AI Với GPT-image-2 — Biến Bất Kỳ Ai Thành Đồ Chơi Trong Hộp GPT-image-2: Nhận Diện Khuôn Mặt Và Phân Tích Màu Sắc Bằng AI Xem chỉ tay với GPT-image-2 — Tạo bản phân tích chỉ tay chuyên nghiệp chỉ từ một bức ảnh GPT-image-2로 AI 밈 생성기 & 컬러링북 만들기 — 재미있고 수익도 되는 프로젝트 GPT-image-2로 AI 미래 아기 예측 — 우리 아이는 어떤 모습일까? GPT-image-2로 지브리 스타일 변환 — 사진을 애니메이션 아트로 바꾸기 GPT-image-2로 AI 액션 피규어 생성하기 — 누구나 박스형 피규어로 바꾸는 법 GPT-image-2로 AI 관상 분석 & 퍼스널 컬러 진단 — 두 가지 바이럴 활용법 완벽 가이드 GPT-image-2 실전 가이드:AI 손금 분석 — 손바닥 사진 한 장으로 전문 손금 인포그래픽 생성하기 GPT-image-2 で AI ミーム生成 & ぬりえブック制作 — 楽しくて本当に稼げるプロジェクト GPT-image-2 で AI 未来の赤ちゃん予測 — 将来の子どもの顔を見てみよう GPT-image-2 でジブリ風写真変換 — どんな写真もアニメアートに GPT-image-2 で AI アクションフィギュア生成 — 誰でもボックス入りおもちゃに変身 GPT-image-2 で AI 顔相診断 & パーソナルカラー分析 — 2つのバズ活用法を1本で解説 GPT-image-2 で AI 手相占い — 1枚の写真からプロ仕様の手相分析を生成 GPT-image-2 на практике: AI-генератор мемов и раскрасок — весёлые проекты, которые приносят деньги GPT-image-2 на практике: AI-предсказание будущего ребёнка — как будет выглядеть ваш малыш GPT-image-2 на практике: стиль Гибли — превратите любое фото в аниме-арт GPT-image-2 на практике: AI-генератор фигурок — превратите себя в коллекционную игрушку GPT-image-2 на практике: AI-физиогномика и анализ цветотипа — два вирусных кейса в одном гайде GPT-image-2 на практике: AI-хиромантия — генерация профессионального анализа ладони по фото GPT-image-2 实战:AI Meme 生成器 & 涂色书制作 — 好玩还能赚钱的两个项目 GPT-image-2 实战:AI 预测未来宝宝 — 看看你们的孩子长什么样 GPT-image-2 实战:吉卜力风格转换 — 把任何照片变成宫崎骏动画 GPT-image-2 实战:AI 手办生成器 — 把任何人变成盒装公仔 GPT-image-2 实战:AI 面相分析 & 个人色彩诊断 — 两大爆款玩法一文搞定 GPT-image-2 实战:AI 看手相 — 一张手掌照片生成专业手相分析图 AI Meme Generator & Coloring Book Creator with GPT-image-2 — Fun Projects That Actually Make Money AI Future Baby Prediction with GPT-image-2 — See What Your Child Might Look Like Ghibli Style Photo Transformation with GPT-image-2 — Turn Any Photo Into Anime Art
text-embedding-3-large 值不值得用?和 text-embedding-3-small 的成本、效果与选型对比
Crazyrouter Team · 2026-05-18 · via Crazyrouter Blog

text-embedding-3-large 值不值得用?和 text-embedding-3-small 的成本、效果与选型对比#

做 RAG 或语义搜索时,很多人都会卡在同一个问题:

我到底该用 text-embedding-3-large,还是用更便宜的 text-embedding-3-small

答案不是“large 一定更好”,也不是“small 足够了”。

更准确的说法是:如果检索质量直接影响业务结果,large 值得测试;如果项目还在早期或数据量特别大,small 往往是更稳的起点。

embedding model cost and quality comparison dashboard

这篇文章从实际项目角度,拆一下 embedding 模型选型该看什么。

先说结论:怎么选?#

可以直接按这个表判断:

场景推荐起点原因
企业知识库问答text-embedding-3-large召回质量更重要
多语言 RAGtext-embedding-3-large非英文和跨语言检索更值得测试
客服机器人large 或 small A/B 测试看错误回答成本
内部工具搜索text-embedding-3-small成本优先,容错较高
MVP / demotext-embedding-3-small先跑通链路
海量文档索引small 或 large 降维控制存储和检索成本
代码/技术文档搜索large + rerank语义和精确匹配都重要

如果你只能记一句话:

先用 small 建基线,再用 large 在真实 query 上评测提升。

text-embedding-3-large 强在哪里?#

text-embedding-3-large 是更高能力的 embedding 模型。

根据 OpenAI 官方文档,它默认输出 3072 维向量,最大输入 8192 tokens,定位是英文和非英文任务上的高能力 embedding 模型。

它的优势主要体现在:

  1. 更强的语义表达能力
  2. 更适合复杂查询
  3. 更适合多语言或跨语言检索
  4. 对长文档知识库更友好
  5. 更适合作为生产级 RAG 的候选模型

但它也有代价:

  • 单位 token 成本更高
  • 默认向量维度更大
  • 向量库存储成本更高
  • 检索时内存和索引压力更大

所以,选 large 的前提应该是:它带来的召回提升能覆盖额外成本。

text-embedding-3-small 适合什么?#

text-embedding-3-small 的定位更偏成本效率。

它适合:

  • FAQ 搜索
  • 小型知识库
  • 早期 MVP
  • 内部检索工具
  • 单语言内容库
  • 对错误召回容忍度较高的场景

很多项目没必要一开始就上 large。

尤其当你还没有真实用户问题、没有评测集、没有线上反馈时,上大模型向量可能只是“感觉更稳”,但你无法证明它真的更好。

成本不只看 API 价格#

Embedding 成本不只是调用模型那一项。

你还要算:

成本项受什么影响
API 调用成本输入 tokens 数量、重复索引次数
向量库存储文档数量、chunk 数、向量维度
检索延迟索引规模、维度、top_k
内存/磁盘向量数量和精度
维护成本重建索引、版本迁移、评测

举个简单例子:

如果你有 100 万个 chunk,每个向量 3072 维,使用 float32 存储,单纯向量数据大约是:

如果降到 1536 维,大约就是一半。

这还不包括索引结构、metadata、数据库额外开销。

所以大规模项目一定要关注 dimensions 参数和向量数据库成本。

dimensions 参数怎么用?#

OpenAI 第三代 embedding 模型支持通过 dimensions 控制输出向量大小。

示例:

这对生产环境很有用。

你可以测试:

  • large 3072 维
  • large 1536 维
  • large 1024 维
  • small 默认维度

然后比较 top 5 召回率、延迟和成本。

选型不要只看 MTEB 分数#

公开 benchmark 有参考价值,但不要把它当最终答案。

你的业务数据可能和 benchmark 完全不同:

  • 用户问题很短
  • 文档是中英混合
  • 内容里有很多产品名和错误码
  • 有大量表格和参数说明
  • 用户经常用口语表达

所以最好建立自己的小评测集。

最简单的格式:

query应召回文档类型
怎么查看余额?billing.mdFAQ
base_url 应该填什么?quickstart.mdtechnical
Claude Code 怎么配置?claude-code.mdintegration
API 调用失败 401 怎么办?auth-errors.mdtroubleshooting

每个模型跑一遍,看 top 3 / top 5 是否命中。

一个可执行的 A/B 测试流程#

推荐你这样测:

1. 准备 50-200 个真实 query#

不要自己拍脑袋写。优先用:

  • 站内搜索日志
  • 客服问题
  • 用户群问题
  • 工单标题
  • 文档评论

2. 标注正确答案文档#

每个 query 标 1-3 个正确 chunk 或文档。

3. 建立多个索引#

例如:

  • index_small_default
  • index_large_3072
  • index_large_1536

4. 跑召回评测#

核心指标:

指标含义
Recall@3前 3 个结果是否包含正确文档
Recall@5前 5 个结果是否包含正确文档
MRR正确文档排得越靠前越好
latency查询耗时
cost索引和查询成本

5. 决定是否升级 large#

如果 large 只提升 1%,但成本高很多,未必值得。

如果 large 把 Recall@5 从 78% 提到 90%,而业务又很依赖准确检索,那就很值得。

RAG 质量差,未必是 embedding 模型的问题#

很多时候,换成 large 也救不了系统。

因为问题可能在别处:

问题表现优先修复
chunk 切坏了找到的内容上下文不完整重新切块
metadata 缺失无法按语言/权限/产品过滤补 metadata
query 太短“扣费问题”召回不稳定query rewrite
文档过期找到了旧答案加更新时间和版本过滤
没有 reranktop 结果相似但不精确加 rerank
prompt 太松模型根据常识乱答强制只根据资料回答

所以选模型前,先保证 RAG 管线别太粗糙。

在 OpenAI 兼容接口中切换 embedding 模型#

如果你通过 OpenAI SDK 接入,切换模型很简单。

如果你用 Crazyrouter 这类 OpenAI 兼容网关,通常不用改 SDK,只改模型名和 base URL。

你可以先在 Crazyrouter Playground 验证调用,再把同样参数放进服务端。

推荐的项目路线图#

阶段 1:MVP#

  • 用 text-embedding-3-small
  • 本地或 pgvector 存储
  • top 5 检索
  • 不加复杂 rerank
  • 目标:跑通链路

阶段 2:真实评测#

  • 收集用户 query
  • 标注正确文档
  • 测 small vs large
  • 调整 chunk 策略
  • 目标:找到召回瓶颈

阶段 3:生产优化#

  • 使用 large 或 large 降维版本
  • 加 hybrid search
  • 加 rerank
  • 加权限过滤
  • 加引用来源
  • 目标:稳定、可解释、可控成本

结论:large 不是默认答案,但值得认真测试#

text-embedding-3-large 的价值在于更强的语义表达能力,尤其适合高质量 RAG、多语言知识库和复杂语义搜索。

但工程上不要盲目上最强模型。

更好的策略是:

  1. 用 small 建立成本和效果基线
  2. 用真实 query 测 large 的提升
  3. 用 dimensions 控制向量大小
  4. 加 rerank 和 hybrid search,而不是只靠换模型
  5. 根据业务错误成本决定是否升级

如果 RAG 结果直接影响用户决策、客服体验或付费转化,text-embedding-3-large 很可能值得。

如果只是内部工具或早期验证,先从 small 开始更务实。

FAQ#

text-embedding-3-large 一定比 text-embedding-3-small 好吗?#

通常能力更强,但不代表每个项目都值得用。要看真实 query 的召回提升是否覆盖成本。

dimensions 降低后会不会影响效果?#

可能会。降维能减少存储和检索成本,但可能降低召回质量。建议用自己的评测集测试。

RAG 项目应该先优化模型还是切块?#

先优化切块和评测。chunk 策略很差时,换更强 embedding 模型也可能效果有限。

多语言知识库更适合 text-embedding-3-large 吗?#

值得优先测试。官方定位里 large 适合英文和非英文任务,多语言检索通常更依赖语义表达能力。

可以用 Crazyrouter 调用 text-embedding-3-large 吗?#

可以通过 OpenAI 兼容的 /v1/embeddings 端点调用。代码里使用 https://crazyrouter.com/v1 作为 base URL 即可。