惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

L
LINUX DO - 最新话题
T
Tor Project blog
G
GRAHAM CLULEY
S
Security Affairs
P
Palo Alto Networks Blog
TaoSecurity Blog
TaoSecurity Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
aimingoo的专栏
aimingoo的专栏
博客园_首页
C
CXSECURITY Database RSS Feed - CXSecurity.com
博客园 - 三生石上(FineUI控件)
Cloudbric
Cloudbric
Cyberwarzone
Cyberwarzone
A
About on SuperTechFans
Microsoft Azure Blog
Microsoft Azure Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
C
CERT Recently Published Vulnerability Notes
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
C
Check Point Blog
宝玉的分享
宝玉的分享
Forbes - Security
Forbes - Security
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Microsoft Security Blog
Microsoft Security Blog
Schneier on Security
Schneier on Security
The Last Watchdog
The Last Watchdog
T
The Blog of Author Tim Ferriss
S
SegmentFault 最新的问题
H
Heimdal Security Blog
Recorded Future
Recorded Future
L
LangChain Blog
WordPress大学
WordPress大学
Know Your Adversary
Know Your Adversary
C
Cyber Attacks, Cyber Crime and Cyber Security
V
Visual Studio Blog
B
Blog
H
Help Net Security
T
Tailwind CSS Blog
The Hacker News
The Hacker News
雷峰网
雷峰网
P
Proofpoint News Feed
博客园 - Franky
Attack and Defense Labs
Attack and Defense Labs
有赞技术团队
有赞技术团队
S
Schneier on Security
T
Troy Hunt's Blog
云风的 BLOG
云风的 BLOG
Hacker News - Newest:
Hacker News - Newest: "LLM"
Blog — PlanetScale
Blog — PlanetScale
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
P
Proofpoint News Feed

博客园 - ExplorerMan

大模型sft微调参数优化2 大模型RAG实战,从被骂不靠谱到成为部门MVP,这是我的踩坑全记录【转】 推荐 Prompt 模板(大幅提升 JSON 质量) [推荐]双塔模型(介绍) Agno - 轻量级Python多智能体系统框架 Open WebUI:打造友好且强大的自托管 AI 平台 【gradio】使用Gradio快速开发前端界面:基础知识 文本切割方案进化概览:从“机械切割”到“智能解构” 大模型RAG的上下文压缩与过滤 SemanticChunker 语义相似拆分 基于LangChain 实现 Advanced RAG-后检索优化(上)-Reranker 基于LangChain 实现 Advanced RAG-后检索优化(下)-上下文压缩与过滤 多Agent协作入门:基于A2A协议的Agent通信(中) ollama部署与open-webui 0基础也能看懂!从0到1手把手教你本地部署大模型Ollama 什么是 AutoModel 大模型基础应用框架(ReACT\SFT\RAG)技术创新及零售业务落地应用 - ExplorerMan - 博客园 多模态Embedding模型:从文本到多模态的全面选型指南! rag 查询检索轮换
渐进式SFT内化
ExplorerMan · 2026-01-27 · via 博客园 - ExplorerMan

想象你在教一个实习生写报告:

  1. 第1周:你给他看完整模板(标题格式、字体要求、段落结构)+ 10个范文

  2. 第2周:你问他"记得模板吗?",只给简化版提示+5个范文

  3. 第3周:你直接说"写个市场调研报告",不给模板,让他凭记忆写

内化就是让AI的"记忆"(模型参数)记住template,而不是每次都在"便签"(system prompt)上贴template。


🛠️ 实操Demo:把"小红书文案生成器"内化成zero-shot

场景设定

我们要让模型学会不写system prompt就能自动写出小红书风格的文案(带emoji、分段、标签)。

原始system prompt很长(约150 tokens):

你是一个小红书爆款文案专家。请使用活泼可爱的语气,每段都要有emoji表情,结尾必须包含5个相关话题标签。禁止使用"首先/其次/总之"等公文词汇,要用姐妹聊天的口吻。

目标:训练后,用户直接输入"推荐一款防晒霜",模型就自动输出小红书风格文案。


环境准备

# 安装依赖
pip install transformers datasets peft trl bitsandbytes accelerate

完整代码(可直接运行)

# ============================================================
# 渐进式SFT内化Demo:小红书文案生成器
# 目标:从"详述指令" -> "内化记忆" -> "零指令"
# ============================================================

import torch
from datasets import Dataset
from transformers import AutoTokenizer, AutoModelForCausalLM, TrainingArguments
from peft import LoraConfig, get_peft_model, PeftModel
from trl import SFTTrainer
import json


📋 使用指南

1. 数据准备(最最关键)

你需要准备:

  • 阶段1:20-50条高质量样本,system prompt写满所有约束(如格式、风格、禁止词)

  • 阶段2:同一批样本,system prompt缩短50%(保留核心关键词)

  • 阶段3:同一批样本,system prompt设为空字符串,只在user里加前缀如"小红书文案:{query}"

2. 训练技巧

  • 学习率递减:阶段1用5e-5,阶段2用2e-5,阶段3用1e-5

  • epoch递增:阶段3要比阶段1更多epoch(让模型"死记"规则)

  • 必须LoRA:使用LoRA/QLoRA,防止破坏模型其他能力

3. 验证标准

成功内化的标志:

# 输入(无任何system prompt)
user: "推荐一款扫地机器人"

# 输出(应该自动符合小红书风格)
姐妹们!扫地自由真的实现了!🎉
这机器人太懂我了...(带emoji)
...

⚠️ 重要提醒

  1. 灾难性遗忘:如果你的模型原本很"通用",微调后可能会变"傻"(只会写小红书文案)。解决方案:

    • 混入10%的通用对话数据一起训练

    • 使用更大的lora_r值(如64)保留表达能力

  2. 回退机制:保存每个阶段的权重,如果阶段3效果差,回退到阶段2

  3. 测试覆盖:阶段3测试时,要用模型没见过的query(如训练里有"防晒霜",测试用"咖啡机")

  4. Prompt Cache清零:每次测试前重启kernel,防止tokenizer的chat template缓存干扰

如果你想把这个Demo应用到你的具体业务(比如法律合同生成、代码规范检查等),只需要替换数据集中的systemassistant内容,保持三阶段结构不变即可!