












提示
Sentence Transformers v6.0 最近已发布,引入了 MultiVectorEncoder(多向量编码器)。这是用于 ColBERT 风格的后期交互检索(late-interaction retrieval)的第四大模型家族,它使用 token 级别(多向量)的嵌入(embeddings),涵盖了文本检索以及 ColPali 风格的视觉文档检索。现有的 ColBERT、PyLate 和 ColPali 模型可以直接开箱即用,并提供完整的训练和评估支持。阅读多向量编码器快速入门、v6.0 发行说明或迁移指南以获取更多细节。
SentenceTransformers 文档
Sentence Transformers(又称 SBERT)是用于使用和训练最先进的嵌入模型和重排(reranker)模型的首选 Python 模块。
它可以用于:通过 Sentence Transformer 模型计算文本、图像、音频或视频的嵌入;通过 Cross-Encoder(又称重排器)模型计算相似度得分;通过 Sparse Encoder 模型生成稀疏嵌入;或者通过 Multi-Vector Encoder 模型计算 token 级别的嵌入,用于 ColBERT 风格的后期交互检索。这解锁了极其广泛的应用场景,包括语义搜索、语义文本相似度计算以及复述挖掘(paraphrase mining)。
在 🤗 Hugging Face 上,有超过 25,000 个预训练的 Sentence Transformers 模型可供立即使用,其中包括许多来自海量文本嵌入基准(MTEB)排行榜上最先进(SOTA)的模型。此外,使用 Sentence Transformers,你可以非常轻松地训练或微调你自己的嵌入模型、重排模型、稀疏编码器模型或多向量编码器模型,从而为你特定的应用场景打造自定义模型。
Sentence Transformers 最初由 UKP 实验室创建,目前由 🤗 Hugging Face 团队维护。如果发现任何故障或有进一步的疑问,请随时在 Sentence Transformers 的开源仓库中提交 Issue。
这段官方文档虽然简短,但信息量极大,它标志着信息检索(IR)和自然语言处理(NLP)领域正在发生的重要技术演进。以下是几个关键重点的深度解读:
Sentence Transformers 如今不再仅仅是“计算句向量”的工具,它已经演变成了一个全栈的神经检索工具包。文档明确指出了其支持的四种核心架构,这涵盖了现代搜索系统的主流管线:
在传统的嵌入模型中,一整篇文章被“强行”压缩成一个单向量,这会导致细节信息的严重丢失(尤其对于长文本)。
ColBERT 风格的后期交互(Late-interaction)改变了这一现状。它不再压缩成一个向量,而是为文本中的每一个 token(词元)保留一个独立的向量(即多向量)。在检索时,Query 的所有词元向量与文档的所有词元向量进行相似度比对。这种机制极大提升了细粒度信息的检索精度,被业界认为是 RAG(检索增强生成)系统走向落地的关键技术之一。
文档中提到了 ColPali 风格的视觉文档检索。这是一个极具前瞻性的特性。传统的文档检索需要先把 PDF 提取成文本(OCR 等),容易丢失图表、排版信息。ColPali 结合了视觉语言模型(VLM)和后期交互技术,直接把页面截图当成图像块处理,实现了不依赖 OCR 的“视觉到视觉”级别的文档检索。Sentence Transformers v6.0 对它的开箱即用支持,极大降低了开发者进入多模态 RAG 领域的门槛。
这段文档宣告了 Sentence Transformers 已经从一个单点工具,进化成了构建现代企业级 RAG 系统、搜索引擎和推荐系统的一站式中枢。特别是 v6.0 对 Token 级后期交互(ColBERT)和视觉检索(ColPali)的支持,紧紧抓住了当下 AI 应用开发中最迫切的两个痛点:召回精度与复杂格式文档解析。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。