惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
Security @ Cisco Blogs
罗磊的独立博客
宝玉的分享
宝玉的分享
Last Week in AI
Last Week in AI
T
The Blog of Author Tim Ferriss
美团技术团队
T
Tailwind CSS Blog
博客园 - 三生石上(FineUI控件)
博客园 - Franky
G
Google Developers Blog
Jina AI
Jina AI
Stack Overflow Blog
Stack Overflow Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
V
Visual Studio Blog
腾讯CDC
S
SegmentFault 最新的问题
Recent Announcements
Recent Announcements
博客园 - 叶小钗
Microsoft Security Blog
Microsoft Security Blog
雷峰网
雷峰网
L
LangChain Blog
Vercel News
Vercel News
Forbes - Security
Forbes - Security
PCI Perspectives
PCI Perspectives
N
News | PayPal Newsroom
S
Security Affairs
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
博客园 - 司徒正美
J
Java Code Geeks
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Hacker News: Ask HN
Hacker News: Ask HN
Schneier on Security
Schneier on Security
A
About on SuperTechFans
Attack and Defense Labs
Attack and Defense Labs
Google Online Security Blog
Google Online Security Blog
aimingoo的专栏
aimingoo的专栏
MongoDB | Blog
MongoDB | Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
酷 壳 – CoolShell
酷 壳 – CoolShell
Cloudbric
Cloudbric
B
Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
P
Proofpoint News Feed
D
DataBreaches.Net
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
B
Blog RSS Feed
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
N
News and Events Feed by Topic

Crazyrouter Blog

Gemini CLI Complete Guide 2026: Repo Automation, CI Agents, and Multi-Model Routing Ideogram AI Guide 2026: Brand Design Automation, API Workflows, and Alternatives GLM 4.6 API Guide 2026: Agents, RAG, Tool Calling, and Bilingual Apps WAN 2.2 Animate Tutorial 2026: Character Consistency, Shot Control, and API Workflows Google Veo3 API Guide 2026: Production Video Pipelines, Prompts, Pricing, and Fallbacks AI API Pricing Comparison 2026: Text, Image, Video, Caching, and Router Costs Codex CLI Installation Guide 2026: Windows, macOS, Linux, Proxies, and CI Setup How to Get a Claude API Key in 2026: Secure Setup for Teams, CI, and Alternatives Gemini Advanced Review 2026: Is It Worth It for Coding, Research, and API Teams? Claude Code Pricing Guide 2026: Team Agent Budgets, API Fallbacks, and Cost Control Seedance 2.0 Pricing: Convert 46 CNY per Million Tokens to Cost per Second Seedance 2.0 计费详解:46元/百万Token换算成每秒多少钱 Seedance 2.0料金解説:100万Tokenあたり46元を1秒あたりコストに換算 Gemini CLI 使用教程 2026:安装、代码示例、代理环境与 API 接入 Gemini 是什么?2026 完整介绍、API 使用教程与价格对比 Qwen2.5-Omni Guide 2026: Real-Time Voice, Vision, and Multimodal Agents Kimi K2 Thinking Guide 2026: Reasoning Workflows, Evals, and Cost Control Google Veo3 API Guide 2026: Batch Video Pipelines, Pricing, and Fallbacks Codex CLI Installation Guide 2026: macOS, Linux, WSL, Proxies, and Dev Containers How to Get a Claude API Key in 2026: Safe Production Setup and Alternatives AI API Pricing Comparison 2026: GPT, Claude, Gemini, Video, and Agent Workloads Gemini Advanced Review 2026: Is It Worth It for Developer Teams? Claude Code Pricing Guide 2026: API Fallbacks, Team Seats, and Budget Control Seedream 4.0 API Tutorial 2026: Batch Image Generation, Product Creative, and Pricing Qwen2.5-Omni Guide 2026: Real-Time Voice, Vision, Text Agents, and API Integration Kimi K2 Thinking Guide 2026: Reasoning Agents, Evaluation Workflows, and API Cost Control WAN 2.2 Animate Tutorial 2026: Character Motion, Shot Control, API Pipelines, and Pricing Google Veo3 API Guide 2026: Production Video Workflows, Prompts, Pricing, and Fallbacks AI API Pricing Comparison 2026: OpenAI, Claude, Gemini, DeepSeek, and Router Costs How to Get a Claude API Key in 2026: Setup, Security, Rotation, and Alternatives Codex CLI Installation Guide 2026: macOS, Linux, WSL, Proxies, and Devcontainers Gemini Advanced Review 2026: Is It Worth It for Developers and API Builders? Claude Code Pricing Guide 2026: CI Agents, Team Seats, and API Budget Planning 一個 API Key 呼叫 GPT、Claude、Gemini:5 分鐘設定教學 AI API Gateway for Singapore and Malaysia Developers: One Endpoint for GPT, Claude and Gemini AI API Gateway for Thai Developers: Use GPT, Claude and Gemini with One Key Cómo usar GPT, Claude y Gemini con una sola API key One API Key for GPT, Claude and Gemini: A Practical Setup for Central Asia Developers Gemini 3.5 Flash vs Claude レスポンスティアモデル:開発者はどちらを選ぶべきか Gemini 3.5 Flash vs Claude Response-Tier Models: Какую модель выбрать разработчику? Gemini 3.5 Flash vs Claude Response-Tier Models: Which One Should Developers Use? Gemini 3.5 Flash vs Gemini 3 Flash vs Gemini 2.5 Flash:実運用APIベンチマーク Gemini 3.5 Flash vs Gemini 3 Flash vs Gemini 2.5 Flash: Real API Benchmark text-embedding-3-large 值不值得用?和 text-embedding-3-small 的成本、效果与选型对比 用 text-embedding-3-large 搭建 RAG 知识库:从切块、向量化到检索排序 AI 扩图 API 指南 2026:Uncrop、Outpaint、gpt-image-2 和 Nano Banana 路线怎么选 How to Test Multiple AI Image Models with One API Key "How to Test Multiple AI Image Models with One API Key" Codex CLI Installation Guide: Setup on macOS, Linux, Windows WSL and CI/CD Gemini CLI 使用教程:开发者终端 AI 助手完全指南 Grok 4 免费使用教程:合法体验路径、API 接入与替代方案 Seedream 4.0 API Tutorial: ByteDance Image Generation for Production Pipelines Kimi K2 Thinking Model: Complete Developer Guide for Reasoning Workflows Luma Ray 2 Review: AI Video Generation Quality, Speed, and API Guide Pika 2.2 New Features Review: Scene Director, Sound Design, and API Updates Google Veo 3 API Guide: Video Generation with Audio for Developers AI Lip Sync Tools Comparison 2026: Best APIs for Talking Avatars and Video Dubbing Gemini Advanced Review May 2026: Is It Worth $20/Month for AI Power Users? Claude Code Pricing in May 2026: Max Plan, Opus 4, and Real Cost Breakdown Hermes Agent + Crazyrouter: One-Click Setup for 627+ AI Models Text-Embedding-3-Small: Complete Guide to OpenAI's Most Popular Embedding Model (2026) Cursor 配置 Crazyrouter 教程:国内用上 GPT-5.4 / Claude 写代码 2026 年国内如何调用 Claude API?Claude Opus / Sonnet 接入完全指南 2026 年国内如何调用 GPT-5.4 API?完整接入指南(含代码示例) AI API 常见报错排查大全:401、429、500、timeout 一篇搞定 2026 年 AI API 中转站哪家好?六大平台横向对比评测 2026 年 DeepSeek R1 API 接入指南:国内最强推理模型怎么调用 Trình Tạo Meme & Sách Tô Màu Bằng AI Với GPT-image-2 — Những Dự Án Vui Mà Vẫn Kiếm Ra Tiền Dự Đoán Em Bé Tương Lai Bằng AI Với GPT-image-2 — Xem Con Bạn Có Thể Trông Như Thế Nào Chuyển Đổi Ảnh Sang Phong Cách Ghibli Với GPT-image-2 — Biến Mọi Bức Ảnh Thành Tranh Anime Tạo Mô Hình Nhân Vật Hành Động Bằng AI Với GPT-image-2 — Biến Bất Kỳ Ai Thành Đồ Chơi Trong Hộp GPT-image-2: Nhận Diện Khuôn Mặt Và Phân Tích Màu Sắc Bằng AI Xem chỉ tay với GPT-image-2 — Tạo bản phân tích chỉ tay chuyên nghiệp chỉ từ một bức ảnh GPT-image-2로 AI 밈 생성기 & 컬러링북 만들기 — 재미있고 수익도 되는 프로젝트 GPT-image-2로 AI 미래 아기 예측 — 우리 아이는 어떤 모습일까? GPT-image-2로 지브리 스타일 변환 — 사진을 애니메이션 아트로 바꾸기 GPT-image-2로 AI 액션 피규어 생성하기 — 누구나 박스형 피규어로 바꾸는 법 GPT-image-2로 AI 관상 분석 & 퍼스널 컬러 진단 — 두 가지 바이럴 활용법 완벽 가이드 GPT-image-2 실전 가이드:AI 손금 분석 — 손바닥 사진 한 장으로 전문 손금 인포그래픽 생성하기 GPT-image-2 で AI ミーム生成 & ぬりえブック制作 — 楽しくて本当に稼げるプロジェクト GPT-image-2 で AI 未来の赤ちゃん予測 — 将来の子どもの顔を見てみよう GPT-image-2 でジブリ風写真変換 — どんな写真もアニメアートに GPT-image-2 で AI アクションフィギュア生成 — 誰でもボックス入りおもちゃに変身 GPT-image-2 で AI 顔相診断 & パーソナルカラー分析 — 2つのバズ活用法を1本で解説 GPT-image-2 で AI 手相占い — 1枚の写真からプロ仕様の手相分析を生成 GPT-image-2 на практике: AI-генератор мемов и раскрасок — весёлые проекты, которые приносят деньги GPT-image-2 на практике: AI-предсказание будущего ребёнка — как будет выглядеть ваш малыш GPT-image-2 на практике: стиль Гибли — превратите любое фото в аниме-арт GPT-image-2 на практике: AI-генератор фигурок — превратите себя в коллекционную игрушку GPT-image-2 на практике: AI-физиогномика и анализ цветотипа — два вирусных кейса в одном гайде GPT-image-2 на практике: AI-хиромантия — генерация профессионального анализа ладони по фото GPT-image-2 实战:AI Meme 生成器 & 涂色书制作 — 好玩还能赚钱的两个项目 GPT-image-2 实战:AI 预测未来宝宝 — 看看你们的孩子长什么样 GPT-image-2 实战:吉卜力风格转换 — 把任何照片变成宫崎骏动画 GPT-image-2 实战:AI 手办生成器 — 把任何人变成盒装公仔 GPT-image-2 实战:AI 面相分析 & 个人色彩诊断 — 两大爆款玩法一文搞定 GPT-image-2 实战:AI 看手相 — 一张手掌照片生成专业手相分析图 AI Meme Generator & Coloring Book Creator with GPT-image-2 — Fun Projects That Actually Make Money AI Future Baby Prediction with GPT-image-2 — See What Your Child Might Look Like Ghibli Style Photo Transformation with GPT-image-2 — Turn Any Photo Into Anime Art
text-embedding-3-large 是干什么的?Embedding 模型入门与 RAG 场景详解
Crazyrouter Team · 2026-05-18 · via Crazyrouter Blog

text-embedding-3-large 是干什么的?Embedding 模型入门与 RAG 场景详解#

你平时调用 GPT、Claude、Gemini,大多数时候是在“生成答案”。但 text-embedding-3-large 这类模型不负责聊天,也不会直接写文章。

它的核心作用是:把文本变成一串数字向量

听起来有点抽象,但它正是 RAG 知识库、语义搜索、相似文章推荐、客服问答、文档检索这些功能背后的基础能力。

text-embedding-3-large semantic search pipeline

如果你想让 AI 从自己的文档里找答案,而不是只靠模型记忆胡猜,embedding 基本绕不开。

text-embedding-3-large 的核心用途是什么?#

text-embedding-3-large 是 OpenAI 的高能力文本向量模型。它会读取一段文本,然后输出一个高维向量。

向量可以理解成文本的“语义坐标”。

比如下面几句话:

  • “如何降低 AI API 成本?”
  • “怎么节省 GPT 接口费用?”
  • “AI 模型调用太贵怎么办?”

关键词不完全一样,但意思接近。Embedding 模型会把它们映射到相近的位置。

这让系统可以做传统关键词搜索做不好的事情:按语义找内容

常见用途包括:

场景embedding 在里面做什么
语义搜索把用户问题和文档都转成向量,找最相似内容
RAG 知识库先检索相关文档,再交给大模型生成答案
推荐系统根据文章、商品、用户描述的语义相似度推荐内容
文档聚类自动把相似文档分组
文本分类用相似度判断文本属于哪个标签
异常检测找出和大多数内容语义距离很远的数据

OpenAI 官方文档也把 embeddings 用于 search、clustering、recommendations、anomaly detection、diversity measurement 和 classification。

为什么 RAG 特别需要 text-embedding-3-large?#

RAG,全称 Retrieval-Augmented Generation,中文可以理解为“检索增强生成”。

它的流程通常是:

  1. 把文档切成小块
  2. 用 embedding 模型把每个文档块转成向量
  3. 存进向量数据库
  4. 用户提问时,把问题也转成向量
  5. 找出最相关的几个文档块
  6. 把这些内容交给大模型回答

如果没有 embedding,系统只能做关键词匹配。

比如用户问:

“余额为什么扣得这么快?”

文档里可能写的是:

“高上下文模型会消耗更多 tokens,费用按输入和输出 tokens 计费。”

关键词几乎对不上,但语义相关。Embedding 就是解决这种问题的。

RAG workflow with embeddings and vector database

text-embedding-3-large 和聊天模型有什么区别?#

很多开发者第一次接触 embedding 会误以为它也是“问答模型”。其实不是。

能力聊天模型embedding 模型
输入用户问题、上下文文本片段
输出自然语言答案数字向量
主要用途生成、总结、推理、对话检索、相似度、聚类、分类
是否直接回答问题
是否适合 RAG负责最终回答负责找资料

可以把它们分工理解为:

  • embedding 模型:图书管理员,负责找资料
  • 聊天模型:写作者,负责组织答案

一个完整的知识库问答系统,通常两者都要用。

text-embedding-3-large 的关键参数#

根据 OpenAI 官方文档,text-embedding-3-large 默认输出 3072 维向量,最大输入上下文为 8192 tokens。

它也支持 dimensions 参数。你可以在保留主要语义信息的前提下,把向量维度降下来。

这很重要,因为向量维度会影响:

  • 向量数据库存储成本
  • 检索速度
  • 索引大小
  • 内存占用

如果你只是做中小型 FAQ、客服知识库,未必一定要 3072 维全量向量。可以先测试 1024 或 1536 维,观察召回质量。

如何用 OpenAI 兼容接口调用 text-embedding-3-large?#

下面是 Python 示例。代码里的 API 地址不要加 UTM 参数。

如果你已经在项目里使用 OpenAI SDK,只需要把 base_url 换成兼容网关地址即可。

你可以通过 Crazyrouter 文档 查看 OpenAI 兼容接入方式,也可以在 价格页面 对比不同模型成本。

一个最小可用的语义搜索示例#

下面用最简单的 cosine similarity 演示 embedding 的工作方式。生产环境建议换成向量数据库,例如 Qdrant、Milvus、Pinecone、pgvector。

这个例子虽然简单,但已经包含了语义搜索的核心逻辑:文本转向量,然后按相似度排序。

什么时候该用 text-embedding-3-large?#

我建议按下面的方式判断:

需求建议
高质量 RAG、跨语言检索、长文档知识库优先测试 text-embedding-3-large
FAQ、小规模搜索、成本敏感项目可以先用 text-embedding-3-small
多语言文档检索更值得测试 large
只做关键词过滤不一定需要 embedding
数据量极大、预算紧先评估降维和分层检索

一句话:如果你的搜索质量直接影响用户体验,text-embedding-3-large 值得优先测试。

如果只是内部工具或早期 MVP,可以先从更便宜的 embedding 模型开始。

RAG 项目里的最佳实践#

1. 文档切块不要太粗#

不要把整篇文档直接塞进去。建议按语义段落切块。

常见范围:

  • 300-800 tokens 一个 chunk
  • 保留 50-100 tokens overlap
  • 标题、路径、时间等 metadata 单独存储

2. 查询也要预处理#

用户问题可能很短、很口语。可以先让聊天模型把问题改写成更适合检索的查询,再做 embedding。

3. 不要只看 top 1#

RAG 通常取 top 3 到 top 10 个文档块,再交给大模型判断。

4. 加 rerank 会更稳#

Embedding 负责粗召回,rerank 负责精排。对于客服、法律、财务、技术文档,rerank 能明显减少答非所问。

5. 记录真实查询日志#

不要只用 demo 数据测试。把真实用户问题脱敏后做评测,才知道召回是否靠谱。

常见误区#

误区 1:embedding 维度越高一定越好#

不一定。高维向量通常表达能力更强,但也更占存储和计算。实际项目要看召回效果、延迟和成本。

误区 2:RAG 有了 embedding 就不会胡说#

也不对。Embedding 只负责找资料。最终回答是否可靠,还取决于 prompt、上下文质量、模型能力和引用约束。

误区 3:所有文档都适合直接向量化#

表格、代码、日志、PDF 扫描件都需要特殊处理。尤其是表格,最好保留结构化字段。

结论:text-embedding-3-large 是 AI 应用的“检索底座”#

text-embedding-3-large 不是用来聊天的模型,而是用来理解文本相似度的模型。

它最适合这些场景:

  • RAG 知识库
  • 语义搜索
  • 多语言检索
  • 推荐系统
  • 文档聚类
  • 文本分类

如果你正在做 AI 客服、企业知识库、文档问答、代码搜索或内容推荐,embedding 模型就是系统的基础层。

你可以通过 OpenAI 兼容接口接入 embeddings API。对于已经使用 OpenAI SDK 的项目,迁移成本很低:改 base_url,换 API key,然后继续使用同样的调用方式。

FAQ#

text-embedding-3-large 可以直接回答问题吗?#

不可以。它输出的是向量,不是自然语言答案。回答问题通常需要搭配 GPT、Claude、Gemini 等聊天模型。

text-embedding-3-large 适合做 RAG 吗?#

适合。它常用于 RAG 的检索阶段,把用户问题和知识库文档转成向量,再找出最相关内容。

text-embedding-3-large 默认多少维?#

官方文档显示默认是 3072 维,也可以通过 dimensions 参数降低输出维度。

text-embedding-3-large 和 text-embedding-3-small 怎么选?#

如果追求检索质量、多语言效果或生产级 RAG,可以优先测试 large。如果成本敏感或数据量很大,可以先用 small 做基线。

向量数据库是必须的吗?#

小规模 demo 可以直接用数组和 cosine similarity。生产环境建议使用向量数据库,例如 pgvector、Qdrant、Milvus 或 Pinecone。