同一条提示词连续运行两次,为什么有时回答相同,有时措辞差异很大?变化来自模型参数、解码策略,还是输入本身?读完本文,可以比较温度对候选概率的影响,并从事实、任务完成度和可读性评估结果。
语言模型每一步给出下一项的候选分布,解码器再决定选谁。这个选择会影响整段文本,但随机性更高不等于质量更好。理解解码参数后,才能为问答、分类和创作任务设置合适边界。
文章目录
- 相同提示词为什么会出现不同回答
- 核心概念与工作机制
- 最小示例
- 验证结果
- 常见误区与适用边界
- 总结
相同提示词为什么会出现不同回答
假设某一步的候选概率分别为“准确”0.55、“迅速”0.35、“可能”0.10。贪心解码总选“准确”;采样允许较低概率候选出现。若把随机性提高,第三个候选更容易被选中,后续文本也随之改变。输出变化不代表模型重新训练过。
| 策略 | 选择方式 | 适用情形 | 主要风险 |
|---|---|---|---|
| 贪心 | 每步取最高概率 | 需要稳定格式的短任务 | 容易重复或局部最优 |
| 温度采样 | 调整分布后抽样 | 需要有限变化的写作 | 高温可能失控 |
| top-k / top-p | 先限制候选再抽样 | 控制极低概率词进入 | 阈值不当会过窄或过宽 |
核心概念与工作机制
概率分布与温度。温度低于 1 时,高概率候选的优势更明显;高于 1 时分布趋于平缓。温度只改变选择的随机性,不会向模型注入新事实,也不能修复错误数据。
停止条件。生成必须受到最大长度、结束 token 或业务格式约束。单靠“请简短