惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
博客园 - Franky
MyScale Blog
MyScale Blog
L
LangChain Blog
Martin Fowler
Martin Fowler
Recent Announcements
Recent Announcements
Stack Overflow Blog
Stack Overflow Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 司徒正美
量子位
A
About on SuperTechFans
C
Check Point Blog
大猫的无限游戏
大猫的无限游戏
Last Week in AI
Last Week in AI
小众软件
小众软件
Apple Machine Learning Research
Apple Machine Learning Research
I
InfoQ
V
Visual Studio Blog
Vercel News
Vercel News
B
Blog
爱范儿
爱范儿
aimingoo的专栏
aimingoo的专栏
U
Unit 42

博客园 - 立体风

autohotkey2.0 Send keys参数分析 autohotkey2.0 盲从模式 windows 10 下 vscode 编写编译一个 nana c++ 库的示例程序 vscode 插件 cmake-tools 输出内容解读 Claude Code 处理中文乱码问题 python 启动器命令 py 答惑 windows 下 python 3.11 的版本问题 pip 安装 老版本 pytorch 的一个容易迷惑的错误 sentence transformer 例子及说明 Jina Reranker 替代方案:改用 ModelScope 模型 Webnovel Writer 6.2.1 项目分析 windows 10 LTSC 版 安装 Terminal autohotkey2.0 脚本运行机制 windows wsl2 安装 gentoo 的步骤 windows 10 LTSC版 打开 wsl2 autohotkey 提示词 编译安装最新版 perl rust 做到“快并且安全” 的逻辑思路 rust 和 go 语言的核心目的 用 vim 查看文件的格式和编码 throughput 和 efficient 词义 python 以字符数量分割文档 (三) python 以字符数量分割文档 (二) python 以字符数量分割文档 (一) GNU Bash 参考手册(中文版)(六) GNU Bash 参考手册(中文版)(五) GNU Bash 参考手册(中文版)(四) GNU Bash 参考手册(中文版)(三) GNU Bash 参考手册(中文版)(二) GNU Bash 参考手册(中文版)(一)
Sentence Transformers 介绍
立体风 · 2026-08-22 · via 博客园 - 立体风

提示
Sentence Transformers v6.0 最近已发布,引入了 MultiVectorEncoder(多向量编码器)。这是用于 ColBERT 风格的后期交互检索(late-interaction retrieval)的第四大模型家族,它使用 token 级别(多向量)的嵌入(embeddings),涵盖了文本检索以及 ColPali 风格的视觉文档检索。现有的 ColBERT、PyLate 和 ColPali 模型可以直接开箱即用,并提供完整的训练和评估支持。阅读多向量编码器快速入门、v6.0 发行说明或迁移指南以获取更多细节。

SentenceTransformers 文档
Sentence Transformers(又称 SBERT)是用于使用和训练最先进的嵌入模型和重排(reranker)模型的首选 Python 模块。

它可以用于:通过 Sentence Transformer 模型计算文本、图像、音频或视频的嵌入;通过 Cross-Encoder(又称重排器)模型计算相似度得分;通过 Sparse Encoder 模型生成稀疏嵌入;或者通过 Multi-Vector Encoder 模型计算 token 级别的嵌入,用于 ColBERT 风格的后期交互检索。这解锁了极其广泛的应用场景,包括语义搜索、语义文本相似度计算以及复述挖掘(paraphrase mining)。

在 🤗 Hugging Face 上,有超过 25,000 个预训练的 Sentence Transformers 模型可供立即使用,其中包括许多来自海量文本嵌入基准(MTEB)排行榜上最先进(SOTA)的模型。此外,使用 Sentence Transformers,你可以非常轻松地训练或微调你自己的嵌入模型、重排模型、稀疏编码器模型或多向量编码器模型,从而为你特定的应用场景打造自定义模型。

Sentence Transformers 最初由 UKP 实验室创建,目前由 🤗 Hugging Face 团队维护。如果发现任何故障或有进一步的疑问,请随时在 Sentence Transformers 的开源仓库中提交 Issue。


深度解读与核心点评

这段官方文档虽然简短,但信息量极大,它标志着信息检索(IR)和自然语言处理(NLP)领域正在发生的重要技术演进。以下是几个关键重点的深度解读:

1. 搜索范式的补全:四大模型家族

Sentence Transformers 如今不再仅仅是“计算句向量”的工具,它已经演变成了一个全栈的神经检索工具包。文档明确指出了其支持的四种核心架构,这涵盖了现代搜索系统的主流管线:

  • 标准 Sentence Transformer(密集型检索 / Dense Retrieval): 将整段文字压缩成一个固定长度的向量。速度极快,适合作为第一阶段的粗排(召回阶段)。
  • Sparse Encoder(稀疏编码器): 类似传统的词频搜索(如 TF-IDF、BM25)的神经网络升级版(例如 SPLADE),它在向量库中主要保留关键词的特征,擅长精准匹配。
  • Cross-Encoder(交叉编码器 / Reranker): 把查询(Query)和文档(Document)放在一起同时计算。准确率最高,但计算量极大,因此通常作为第二阶段的精排(重排阶段)。
  • Multi-Vector Encoder(多向量编码器,v6.0 核心更新): 这是本次更新的重头戏,它完美平衡了密集型检索的速度与交叉编码器的精度。

2. v6.0 的杀手锏:Late-Interaction(后期交互)

在传统的嵌入模型中,一整篇文章被“强行”压缩成一个单向量,这会导致细节信息的严重丢失(尤其对于长文本)。
ColBERT 风格的后期交互(Late-interaction)改变了这一现状。它不再压缩成一个向量,而是为文本中的每一个 token(词元)保留一个独立的向量(即多向量)。在检索时,Query 的所有词元向量与文档的所有词元向量进行相似度比对。这种机制极大提升了细粒度信息的检索精度,被业界认为是 RAG(检索增强生成)系统走向落地的关键技术之一。

3. 从纯文本走向多模态(ColPali 架构)

文档中提到了 ColPali 风格的视觉文档检索。这是一个极具前瞻性的特性。传统的文档检索需要先把 PDF 提取成文本(OCR 等),容易丢失图表、排版信息。ColPali 结合了视觉语言模型(VLM)和后期交互技术,直接把页面截图当成图像块处理,实现了不依赖 OCR 的“视觉到视觉”级别的文档检索。Sentence Transformers v6.0 对它的开箱即用支持,极大降低了开发者进入多模态 RAG 领域的门槛。

4. 强大的生态统治力

  • 25,000+ 模型与 MTEB 集成: Sentence Transformers 直接与 Hugging Face 平台以及 MTEB(当前最具权威性的嵌入模型排行榜)深度绑定。这意味着学术界刚出的 SOTA 模型,开发者马上就能用几行代码在工业界跑起来。
  • 训练与推理一体化: 它不仅是个推理工具,还支持所有四种模型家族的微调。这解决了企业“通用模型在垂直领域表现不佳,需要基于私有数据训练”的核心痛点。

总结

这段文档宣告了 Sentence Transformers 已经从一个单点工具,进化成了构建现代企业级 RAG 系统、搜索引擎和推荐系统的一站式中枢。特别是 v6.0 对 Token 级后期交互(ColBERT)和视觉检索(ColPali)的支持,紧紧抓住了当下 AI 应用开发中最迫切的两个痛点:召回精度与复杂格式文档解析