惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
Webroot Blog
Webroot Blog
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
T
Threat Research - Cisco Blogs
V2EX - 技术
V2EX - 技术
L
LINUX DO - 热门话题
Google DeepMind News
Google DeepMind News
Recorded Future
Recorded Future
S
Schneier on Security
I
InfoQ
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
The GitHub Blog
The GitHub Blog
S
Security @ Cisco Blogs
O
OpenAI News
W
WeLiveSecurity
Vercel News
Vercel News
阮一峰的网络日志
阮一峰的网络日志
Simon Willison's Weblog
Simon Willison's Weblog
人人都是产品经理
人人都是产品经理
Cloudbric
Cloudbric
The Last Watchdog
The Last Watchdog
The Hacker News
The Hacker News
Google Online Security Blog
Google Online Security Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
GbyAI
GbyAI
NISL@THU
NISL@THU
T
Tailwind CSS Blog
V
Visual Studio Blog
PCI Perspectives
PCI Perspectives
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Jina AI
Jina AI
D
DataBreaches.Net
B
Blog RSS Feed
N
News and Events Feed by Topic
N
News and Events Feed by Topic
H
Heimdal Security Blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
腾讯CDC
Latest news
Latest news
V
Vulnerabilities – Threatpost
Hacker News: Ask HN
Hacker News: Ask HN
WordPress大学
WordPress大学
V
V2EX
aimingoo的专栏
aimingoo的专栏
博客园 - 司徒正美
Apple Machine Learning Research
Apple Machine Learning Research
D
Darknet – Hacking Tools, Hacker News & Cyber Security
The Register - Security
The Register - Security
Help Net Security
Help Net Security

博客园 - ExplorerMan

大模型sft微调参数优化2 大模型RAG实战,从被骂不靠谱到成为部门MVP,这是我的踩坑全记录【转】 推荐 Prompt 模板(大幅提升 JSON 质量) [推荐]双塔模型(介绍) Agno - 轻量级Python多智能体系统框架 Open WebUI:打造友好且强大的自托管 AI 平台 【gradio】使用Gradio快速开发前端界面:基础知识 文本切割方案进化概览:从“机械切割”到“智能解构” 大模型RAG的上下文压缩与过滤 SemanticChunker 语义相似拆分 基于LangChain 实现 Advanced RAG-后检索优化(上)-Reranker 基于LangChain 实现 Advanced RAG-后检索优化(下)-上下文压缩与过滤 多Agent协作入门:基于A2A协议的Agent通信(中) ollama部署与open-webui 0基础也能看懂!从0到1手把手教你本地部署大模型Ollama 什么是 AutoModel 大模型基础应用框架(ReACT\SFT\RAG)技术创新及零售业务落地应用 - ExplorerMan - 博客园 多模态Embedding模型:从文本到多模态的全面选型指南! rag 查询检索轮换
渐进式SFT内化
ExplorerMan · 2026-01-27 · via 博客园 - ExplorerMan

想象你在教一个实习生写报告:

  1. 第1周:你给他看完整模板(标题格式、字体要求、段落结构)+ 10个范文

  2. 第2周:你问他"记得模板吗?",只给简化版提示+5个范文

  3. 第3周:你直接说"写个市场调研报告",不给模板,让他凭记忆写

内化就是让AI的"记忆"(模型参数)记住template,而不是每次都在"便签"(system prompt)上贴template。


🛠️ 实操Demo:把"小红书文案生成器"内化成zero-shot

场景设定

我们要让模型学会不写system prompt就能自动写出小红书风格的文案(带emoji、分段、标签)。

原始system prompt很长(约150 tokens):

你是一个小红书爆款文案专家。请使用活泼可爱的语气,每段都要有emoji表情,结尾必须包含5个相关话题标签。禁止使用"首先/其次/总之"等公文词汇,要用姐妹聊天的口吻。

目标:训练后,用户直接输入"推荐一款防晒霜",模型就自动输出小红书风格文案。


环境准备

# 安装依赖
pip install transformers datasets peft trl bitsandbytes accelerate

完整代码(可直接运行)

# ============================================================
# 渐进式SFT内化Demo:小红书文案生成器
# 目标:从"详述指令" -> "内化记忆" -> "零指令"
# ============================================================

import torch
from datasets import Dataset
from transformers import AutoTokenizer, AutoModelForCausalLM, TrainingArguments
from peft import LoraConfig, get_peft_model, PeftModel
from trl import SFTTrainer
import json


📋 使用指南

1. 数据准备(最最关键)

你需要准备:

  • 阶段1:20-50条高质量样本,system prompt写满所有约束(如格式、风格、禁止词)

  • 阶段2:同一批样本,system prompt缩短50%(保留核心关键词)

  • 阶段3:同一批样本,system prompt设为空字符串,只在user里加前缀如"小红书文案:{query}"

2. 训练技巧

  • 学习率递减:阶段1用5e-5,阶段2用2e-5,阶段3用1e-5

  • epoch递增:阶段3要比阶段1更多epoch(让模型"死记"规则)

  • 必须LoRA:使用LoRA/QLoRA,防止破坏模型其他能力

3. 验证标准

成功内化的标志:

# 输入(无任何system prompt)
user: "推荐一款扫地机器人"

# 输出(应该自动符合小红书风格)
姐妹们!扫地自由真的实现了!🎉
这机器人太懂我了...(带emoji)
...

⚠️ 重要提醒

  1. 灾难性遗忘:如果你的模型原本很"通用",微调后可能会变"傻"(只会写小红书文案)。解决方案:

    • 混入10%的通用对话数据一起训练

    • 使用更大的lora_r值(如64)保留表达能力

  2. 回退机制:保存每个阶段的权重,如果阶段3效果差,回退到阶段2

  3. 测试覆盖:阶段3测试时,要用模型没见过的query(如训练里有"防晒霜",测试用"咖啡机")

  4. Prompt Cache清零:每次测试前重启kernel,防止tokenizer的chat template缓存干扰

如果你想把这个Demo应用到你的具体业务(比如法律合同生成、代码规范检查等),只需要替换数据集中的systemassistant内容,保持三阶段结构不变即可!