668 字
3 分钟
LLMs Get Lost In Multi-Turn Conversation
论文将完整指令拆成片段,在多轮对话中逐步补充。6 类生成任务的实验显示,主流 LLM 的平均性能下降约 39%,且同一任务的多次回答更不稳定。
作者: Philippe Laban, Hiroaki Hayashi, Yingbo Zhou, Jennifer Neville 论文: arXiv<2505>2505>.06120 代码: 未公开(论文报告实验框架)
研究核心
真实对话中,用户常常逐步补充需求,而现有评测多使用一次给全的指令。论文通过**指令分片(sharding)**模拟这一差异:每轮只提供一个片段,观察模型如何处理后续信息。
实验方法
- sharding 过程:将高质量单轮 benchmark 的完整指令拆成多段(shard),保留原始语义。
- 仿真对话环境:三类设置:
- FULL:完整单轮
- CONCAT:多段信息拼接成单轮(用于排除重述损失)
- SHARDED:逐轮揭示片段(核心设置)
- 指标定义:
- 平均性能 P
- Aptitude A90(第90百分位,近似“最好情况”)
- Unreliability U10-90(第90与第10差值,量化波动)
- 实验覆盖 6 个任务(编程/数据库/API/math/表述/长文摘要)、600 条指令、15 个模型、>200k 条模拟对话。
主要发现
- 所有模型在 SHARDED 下均显著变差,平均约 -39%(与 FULL 对比)。
- 能力下降主要来自“失去一致性”:Aptitude 下降较小,Unreliability 大幅增加(常翻倍以上),即同一模型在同一指令上运行波动变大。
- CONCAT 与 FULL 接近,说明问题并非单纯重写/信息丢失,而是多轮对话中信息逐步补全的影响。
- 无论开源或闭源、规模大小,较强模型也会出现类似程度的退化,说明现象并非只出现在弱模型。
对话为什么会走偏
作者在附录中归因于:
- 早期过度做前提假设
- 提前给出最终答案(answer attempt)
- 过度依赖自己的先前错误尝试
- 回答过长导致注意力漂移
结果是对话一旦走偏,模型很难自我纠偏。
工程与应用启示
- 温度降为 0/0.5 只能部分提升单轮稳定性, 在 SHARDED 场景改善有限。
- 在“应用层”尝试重复回顾用户信息(Recap/Snowball)可有改善,但仍达不到单轮完整指令的水平。
- 对用户建议:若对话质量不稳,可以尝试整理已有约束,在新对话中一次提供。
研究边界
实验采用 LLM 进行全自动模拟用户,场景较理想化;真实人类对话中的偏离、摩擦、非信息性打断等因素可能让问题更复杂。
LLMs Get Lost In Multi-Turn Conversation
https://blog.lpkt.cn/posts/papers/llms-get-lost-in-multi-turn-conversation/