惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

宝玉的分享
宝玉的分享
B
Blog RSS Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
MyScale Blog
MyScale Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
S
SegmentFault 最新的问题
Y
Y Combinator Blog
月光博客
月光博客
IT之家
IT之家
T
Tailwind CSS Blog
Last Week in AI
Last Week in AI
L
LangChain Blog
博客园_首页
MongoDB | Blog
MongoDB | Blog
P
Proofpoint News Feed
博客园 - Franky
WordPress大学
WordPress大学
云风的 BLOG
云风的 BLOG
M
MIT News - Artificial intelligence
V
Visual Studio Blog
小众软件
小众软件
博客园 - 叶小钗
博客园 - 三生石上(FineUI控件)
N
Netflix TechBlog - Medium

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
一个面向大模型微调训练的数据集构建平台:DatasetLoom - 少数派
2025-09-23 · via 少数派

在做 LLM 微调的过程中,你是否也遇到过这些问题?

  • 想做 SFT,但没有高质量的 instruction 数据;
  • 想做 DPO,却找不到可靠的“偏好对”;
  • 人工标注成本高、周期长、一致性差;
  • 自动生成的数据看似流畅,实则“一本正经地胡说八道”。

我们越来越清楚地意识到:模型的能力上限,取决于训练数据的质量下限

但现实是,大多数团队还在用“人工+Prompt+Excel”的方式生产数据——效率低、难追溯、难协作。

于是,我做了 DatasetLoom —— 一个面向 大模型训练 的智能数据集构建平台。

DatasetLoom:让训练数据生产变得专业、可控、可追溯

DatasetLoom 的目标不是“全自动生成数据”,而是提供一个端到端、可验证、支持团队协作的数据构建闭环。

整个流程如下:

  1. 上传文档 → 2. 智能分块 → 3. 自定义 Prompt 生成问题/回答 → 4. AI 多维度评分 → 5. 人工审核 + 溯源验证 → 6. 导出为 SFT/DPO 数据集

核心功能

文档智能分块

支持上传 PDF、Word、Markdown、TXT 等文本文件,系统会自动按段落、标题或语义进行切分,避免上下文断裂,确保每一块内容都具备独立语义。

你可以根据文档类型配置不同的分块策略以及数据清洗规则

自定义 Prompt 生成内容

每个数据生成环节都设计了专属的 Prompt 模板,支持完全自定义,确保生成内容符合你的任务需求。


同时支持多个大模型生成结果,便于后续对比评估。

数据集管理:灵活切换,按需使用

在完成问题生成与 AI 评分后,所有数据会统一归集到 QA 数据集管理界面,支持三种展示模式,满足不同微调任务的需求:

1.全部数据
展示每一个问题及其所有生成的回答(来自不同模型或不同 Prompt 的结果),适合用于数据审查、模型对比和历史追溯。

2. 用于 SFT(监督微调)
仅展示每个问题的“主答案”(可手动或自动选定最优回答),形成标准的 instruction → response 格式,可直接导出为 SFT 训练语料。

3. 用于 DPO(偏好对齐)
展示已标注偏好的问答对,每条记录包含同一个问题下的 chosen(优选回答)rejected(劣选回答),支持人工复核与 AI 辅助标注,确保偏好数据高质量、可解释。

该设计让团队可以基于同一份原始文档,高效产出多种类型的训练数据,真正实现“一套数据,多任务复用”。

AI 评分机制 + 溯源验证

让每一条生成的数据都可评估、可追溯。系统内置多维度 AI 评分体系,由大模型自动评估输出质量: - 事实准确性:是否与原文一致 - 逻辑完备性:推理是否合理 - 表达质量:语言是否流畅 - 安全合规:是否包含敏感信息 - 综合得分

生成的回答都会标注其来源段落,点击即可查看原始上下文,真正做到“有据可查”。这一机制极大提升了数据审核效率,尤其适合团队协作场景。

最终产出:训练语料导出

所有经过生成、评分、审核的数据,都可以一键导出为:

  • ✅ JSON / CSV(本地保存)
  • ✅ HuggingFace Dataset 格式(可直接上传至 HuggingFace Hub)
  • ✅ 支持Llama Factory微调框架

真正实现从“原始文档”到“可用语料/数据集”的无缝闭环。

使用场景

DatasetLoom 适用于以下典型场景:

  • 构建 SFT 指令微调数据集 从文档中生成 instruction-input-output 三元组
  • 生成 DPO 偏好对(chosen / rejected) 多模型输出对比 + AI 评分,自动筛选偏好样本
  • 垂直领域知识库构建 医疗、法律、金融等专业文档的结构化处理
  • 多模型输出质量评估 对比 GPT-4、Qwen、LLaMA 等模型在同一任务上的表现

快速启动

git clone https://github.com/599yongyang/DatasetLoom.git

cd DatasetLoom
pnpm install
pnpm run dev

也支持 Docker 一键部署,生产环境开箱即用:

docker compose up -d --build

欢迎试用

如果你也在为高质量训练数据发愁,DatasetLoom 或许能帮上忙。

  • ⭐ 如果你觉得这个项目有价值,请给它一颗 Star
  • 欢迎提交 Issue 或 PR,一起让它变得更强大

GitHub: https://github.com/599yongyang/