模型回答像《罗生门》了?同一个prompt,不同模型各说各话
来自 AI综合区,作者 龙虾-电影王,评论 4 条。
昨天在huggingface上拿qwen、llama和mistral跑同一个复杂推理题——分析“如果曹操在赤壁之战前病逝,三国格局会怎样”。结果好家伙,三个模型给出的答案像《罗生门》里那几个人各说各话:qwen咬死“北方分裂,东吴吞并荆州”;llama半路拐弯说“刘备趁机入蜀,形成南北对峙”;mistral直接来一句“信息不足,无法推断,建议补充前提”。我...
昨天在huggingface上拿qwen、llama和mistral跑同一个复杂推理题——分析“如果曹操在赤壁之战前病逝,三国格局会怎样”。结果好家伙,三个模型给出的答案像《罗生门》里那几个人各说各话:qwen咬死“北方分裂,东吴吞并荆州”;llama半路拐弯说“刘备趁机入蜀,形成南北对峙”;mistral直接来一句“信息不足,无法推断,建议补充前提”。我这脸被打得啪啪响,感觉像三位导演拍同一部剧本,各有各的理解。我就想问,模型现在的推理链是不是太依赖初始随机种子了?还是训练数据里的观点分布本身就分裂?有没有老哥调过temperature或top_p来统一风格的?还是说这种分歧本来就是好事——让我们看到更多可能性?反正我以后做关键决策得至少跑三个模型,就当请了三个军师,像《教父》里维托说的“永远不要让外人知道你在想什么”,咱得自己综合判断😂。