大多数人问哪个模型最好,等着听到一个名字。老实的回答是:这个问题少了两个字——最好,是在哪件事上最好。一个能写出漂亮慢热文字的模型,往往在第四十条回复上把剧情线弄丢;而能把剧情攥住的那个,写出来像一份称职的报告。
你不必一次定终身。角色、它的性格和它记住的一切,跟生成文字的那个模型是分开的,所以换模型是按场景做的选择,不是一次承诺。
每一类各擅长什么
一共五个,它们是真正不同的乐器,而不是同一样东西的五个尺码。
- Standard——每个新角色都跑在它上面。快、稳,大多数场景够用。你根本不用去挑它;它本来就在那儿。
- GLM——场景变复杂时往上一档。逻辑更紧,能在很长的一段来回里守住一个计划。
- Claude Opus——文字和潜台词最厚。慢热的场景、锋利的克制、说出来的比想说的少的那种角色。
- Google Gemma——快、暖、爱玩。适合轻快的斗嘴和一来一回的闲聊。
- DeepSeek——把又长又绕的故事拢在一起,线不丢。
怎么看出你挑错了
症状是具体的,认识了以后你就不用再猜。
回复很漂亮,可剧情悄悄不动了。三个场景之前有人许下过什么,之后再没人提起。这是推理的问题——往 GLM 或者 DeepSeek 那边挪。
什么都通顺,可什么都不扎人。角色把意思一句不落、按顺序说清楚,一点潜台词都没有。这是文字的问题,Claude Opus 就是干这个的。
本该轻快的场景,变得又硬又客气。这时候一个更暖更快的模型,比一个更能干的更合适;Gemma 的位置就在这里。
角色跟很早以前定下的事情打架。先去看记忆,别急着怪模型——如果那件事从来没被写下来,哪个模型都不会正好把它编对。
换模型不会重置任何东西
模型不是角色的一部分。人设、记忆、场景和历史全都原地不动;变的只是生成下一条回复的那个东西。
这让换模型便宜到可以当工具用,而不是当决定用。常见的打法是:场景里的一来一回用快的那个,到了要紧的那一刻再换成更厚的那个——一次告白、一次对峙、一个结局。
有件事要有心理准备:声音会稍微变一点。同一份人设交给两个模型,听上去不会一模一样,段落中途换的话,接缝是看得见的。在场景之间换、而不是在场景里面换,几乎能把它完全藏住。
采样比大家以为的更要紧
模型选择定的是上限;采样参数决定你落在这个范围里的哪一处。temperature 管的是一条回复有多好猜——低一点更稳,高一点更意外。其余那些(top_p、top_k、min_p、重复惩罚)约束的是模型压根会考虑哪些候选词。
一个感觉很平的模型,往往是 temperature 的问题,不是模型的问题。一个每隔四条回复就把某句口头禅搬出来的角色,是重复惩罚的问题。
这些参数按角色、按套餐都开放给你调,还能导出成 JSON 再导回来,所以一套好用的数值可以存下来、搬着走,不必每次凭记忆重搭。
这份阵容是什么,不是什么
五个模型,选它们是因为它们覆盖的地方确实不一样,而不是为了让一个数字好看。阵容会随着更好的模型出现而变——这是一个路由决定,不是对具体名字的承诺。
这里没有排名,因为排名完全取决于你眼前的这个场景。一个页面要是告诉你某个模型在角色扮演上就是最好的,那它一定没试过需要换一个的那种场景。