














agent 经典的ReAct过程:
接收任务--》LLM 思考任务规划-->第一次循环返回结果 --》LLM-->第2次循环返回结果:(多次循环直到最终返回想要的答案)
--- Step 1 ---
Thought: 需要先获取北京今天的天气气温,才能与上海气温比较。
Action: get_weather
Action Input: {"city": "北京"}
Observation: {"temp": "12°C", "weather": "晴", "humidity": "45%"}
--- Step 2 ---
Thought: 已获得北京气温 12°C,接下来获取上海今天气温,以便计算温差并比较户外活动适宜度。
Action: get_weather
Action Input: {"city": "上海"}
Observation: {"temp": "18°C", "weather": "多云", "humidity": "72%"}
--- Step 3 ---
Thought: 已知北京 12°C、上海 18°C,需要计算气温差值。
Action: calculate
Action Input: {"expression": "18 - 12"}
Observation: {"expression": "18 - 12", "result": 6}
--- Step 4 ---
Thought: 综合信息得出结论
Final Answer: 北京和上海今天气温差 6 度(上海 18°C,北京 12°C)。北京今天为晴天且湿度较低(45%),体感更清爽,更适合户外活动;上海虽气温稍高,但多云且湿度较大(72%),可能略显闷热。
===================
大模型幻觉产生的原因:
训练数据问题
训练机制问题:预训练,监督微调SFT,基于人类反馈的自学习RLHF
采样策略的影响:温度越高,topp,topk越大,模型越容易生成低概率的词,从而产生幻觉
上下文窗口的限制,过长的上下文,模型可能忘记前面的关键信息产生幻觉
如何避免产生幻觉:
1.核心思想是不让模型闭卷考试,而是让它开卷考试
2.训练搞质量数据,实时监督微调,改进RLHF的奖励机制
3.提示词精心设计,温度,top-p,top-k采样合理范围
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。