会话中途换模型,之前所有输入 token 要按全价重付一遍。一位模型公司的联合创始人把这称作推理的基本原理,而不是某家产品的怪癖。但底下吵翻了。

一条四千多赞的帖子,四句话,说的是很多人每天都在做的一个动作:在一次对话里换模型。

说这话的人是一家模型公司的联合创始人兼首席工程师,之前在另一家做基础模型的公司。他特意加了最后那句——这不是他自家产品的毛病,是所有模型都一样。

大模型在处理你的上下文时会缓存一部分中间结果,也就是常说的 KV cache。它省下的是重复计算:同一段上下文第二次送进去,不用从头再算一遍。

问题在于这份缓存是跟着模型权重走的。换一个模型,权重变了,那份缓存对新模型没有任何意义——它没法迁移,只能重建。而重建的意思就是把你之前所有的上下文重新当作新输入,按全价计费。

抽象地说「重付一次」没有体感。讨论里有人给了自己跑出来的数字:

这两个数字揭示的是同一件事:代价不是固定的,它随你带着的上下文长度放大。会话刚开始时切几乎没有成本,聊到很深了再切,那一次的账单就很难看。

这才是这条帖子有意思的地方。它不是一条被集体点头的技巧贴,回复区里至少有三种明确的反对。

这个反驳没有质疑机制,它质疑的是结论里隐含的那句「所以别切」。同一笔开销,算在钱上很贵,算在人的时间上可能很便宜。

这个类比把讨论抬到了另一层:冷启动上下文是有成本的,但那只是一项成本,不是一条禁令。该由运行时去判断——换来的能力提升值不值这次冷启动。

还有一种更干脆的态度:输入 token 已经便宜到不值得为它动脑筋。这话在小规模玩具项目上大概成立,在长上下文、高频调用的场景里未必。

把两边的说法合起来看,真正的分歧其实不在「切不切」,而在「什么时候切」。机制那一半没有人反对,被反对的只是那句「别再这么干」。

一条四句话的帖子能引出这么多分歧,说明它戳到的不是一个技巧,而是一个大家各自算过、答案却不一样的账。

内容整理自海外公开信息,仅供参考。