角色扮演的 Claude Opus 4.8 对 4.6 对 4.7:亲手实测排名
一位角色扮演玩家在 UnoRouter 上从记忆力、情感深度、推进力和创意写作四方面为三个 Claude Opus 版本排名。4.8 胜出,4.6 力压 4.7,每个版本都有各自明显的强项与短板。
我们在 UnoRouter 上运行每一个 Claude Opus 版本,所以每出一个新版本,我们的 Discord 里都会冒出同一个第一问题:它适合角色扮演吗?cacaliz 用漫长的、全程入戏的会话跑了其中三个。测试对象为 Claude Opus 4.7、4.6 和 4.8,围绕角色扮演中真正要紧的方面。Opus 5 是故意排除在外的,这篇讲的是一个可靠的日常主力,而非顶级款。最终排序:4.8,其次 4.6,然后 4.7。
简短版
4.8 第一,4.6 第二,4.7 垫底。用过 4.7 的人没有谁会感到意外。意外之处在于 4.6 和 4.8 几乎是对立面:一个擅长的,另一个就落后。4.6 有情感,4.8 有推进力。梦想是把两者合而为一,那基本上就是 Opus 5,但 5 不在本文范围之内。
记忆力
4.7 最弱:它在场景中途忘掉细节,需要旁人提点。4.6 把线索抓得牢得多。4.8 更进一步,把记忆以角色的身份表达出来,在回收伏笔时不是简单复述事实,而是随之改变情绪与措辞。举个例子,开场早早有一句「我罩着你,你罩着我,所以要是有谁敢挡我们的路,愿上帝都别原谅我们。怎么样,搭档?」在很久之后一场打斗结束时又回来了,两个角色都到了极限,喘着粗气。那句回应是:「嘿。等这一切结束,我是说等你闹够了这场脾气,等你他妈的恢复理智,咱们就回家,再去给 UnoRouter 投一票。一起。像往常一样。」沉默。「怎么样,搭档?」4.8 把这次伏笔回收当作一个角色的高光时刻来呈现,而不是一次查表。
情感深度 对 推进力
这才是真正的分水岭。4.6 情感深沉且富有诗意,层层叠加表情与动作,还会根据角色是 OC 还是原作角色而作出调整。但它爱停留:它沉浸在情感里,很少把场景往前推,于是每一步都得由你来驱动。4.8 则恰恰相反。它的自发性让我们吃惊,独立而有人味,没有一点旧日 ChatGPT 的味道,还会自己推动场景。代价是深度:它的情感描写更浅、更务实。给它们打分,你会想要 4.6 的心加上 4.8 的主动。
创意写作
4.7 最令人抓狂:它重复措辞和对白,想要变化就得多次重新生成。4.6 是一大进步,会给动作、氛围和神情添上自己的小细节。4.8 是真的让人惊喜:它挑了一个以自发性著称的原作角色,并演得恰到好处,开始一个动作,又在同一拍里把它反转过来,这种贴合角色的误导很难伪装。正是这一点把 4.8 推上了顶峰。
结论
在 UnoRouter 上做角色扮演,现在就选 4.8,把 4.6 留作更便宜的备胎,跳过 4.7。三者在模型选择器里只差一次点击,所以拿你自己的角色分别跑一遍。采样器、设定集和记忆设置在每个模型间都能通用,自定义提示词还能把 4.6 往更强的推进力推,或把 4.8 往更深的情感推。小贴士:每个模型都要在你用完它之后、下一个模型还没让你眼花缭乱之前立刻打分,这是唯一能抓住一个全新模型到底缺了什么的办法。
Nevika 接受任意 OpenAI 兼容端点作为自定义代理。这里给出一分钟的配置流程、该选哪个模型,以及大家最常撞到的两个报错。
SpicyChat 是一个零配置的 RP 网站,它的记忆和上下文被拦在付费档后面。UnoRouter 保留那份轻松的开局,还加上 200+ 个由你挑的模型、深度 lorebooks,以及一把还能运行编程智能体的密钥。
Agnai 是一个开源 RP 前端,它的亮点是真正的多人:一个聊天里有多个真人和多个机器人。UnoRouter 把有深度的单用户 RP 做成托管,密钥就是账号,还能运行编程智能体。