角色扮演的 Claude Opus 4.8 對 4.6 對 4.7:親手實測排名
一位角色扮演玩家在 UnoRouter 上從記憶力、情感深度、推進力與創意寫作四方面為三個 Claude Opus 版本排名。4.8 勝出,4.6 力壓 4.7,每個版本都有各自明顯的強項與短板。
我們在 UnoRouter 上執行每一個 Claude Opus 版本,所以每出一個新版本,我們的 Discord 裡都會冒出同一個第一問題:它適合角色扮演嗎?cacaliz 用漫長的、全程入戲的會話跑了其中三個。測試對象為 Claude Opus 4.7、4.6 和 4.8,圍繞角色扮演中真正要緊的方面。Opus 5 是刻意排除在外的,這篇講的是一個可靠的日常主力,而非頂級款。最終排序:4.8,其次 4.6,然後 4.7。
簡短版
4.8 第一,4.6 第二,4.7 墊底。用過 4.7 的人沒有誰會感到意外。意外之處在於 4.6 和 4.8 幾乎是對立面:一個擅長的,另一個就落後。4.6 有情感,4.8 有推進力。夢想是把兩者合而為一,那基本上就是 Opus 5,但 5 不在本文範圍之內。
記憶力
4.7 最弱:它在場景中途忘掉細節,需要旁人提點。4.6 把線索抓得牢得多。4.8 更進一步,把記憶以角色的身分表達出來,在回收伏筆時不是單純複述事實,而是隨之改變情緒與措辭。舉個例子,開場早早有一句「我罩著你,你罩著我,所以要是有誰敢擋我們的路,願上帝都別原諒我們。怎麼樣,搭檔?」在很久之後一場打鬥結束時又回來了,兩個角色都到了極限,喘著粗氣。那句回應是:「嘿。等這一切結束,我是說等你鬧夠了這場脾氣,等你他媽的恢復理智,咱們就回家,再去給 UnoRouter 投一票。一起。像往常一樣。」沉默。「怎麼樣,搭檔?」4.8 把這次伏筆回收當作一個角色的高光時刻來呈現,而不是一次查表。
情感深度 對 推進力
這才是真正的分水嶺。4.6 情感深沉且富有詩意,層層疊加表情與動作,還會根據角色是 OC 還是原作角色而作出調整。但它愛停留:它沉浸在情感裡,很少把場景往前推,於是每一步都得由你來驅動。4.8 則恰恰相反。它的自發性讓我們吃驚,獨立而有人味,沒有一點舊日 ChatGPT 的味道,還會自己推動場景。代價是深度:它的情感描寫更淺、更務實。給它們打分,你會想要 4.6 的心加上 4.8 的主動。
創意寫作
4.7 最令人抓狂:它重複措辭和對白,想要變化就得多次重新生成。4.6 是一大進步,會給動作、氛圍和神情添上自己的小細節。4.8 是真的讓人驚喜:它挑了一個以自發性著稱的原作角色,並演得恰到好處,開始一個動作,又在同一拍裡把它反轉過來,這種貼合角色的誤導很難偽裝。正是這一點把 4.8 推上了頂峰。
結論
在 UnoRouter 上做角色扮演,現在就選 4.8,把 4.6 留作更便宜的備胎,跳過 4.7。三者在模型選擇器裡只差一次點擊,所以拿你自己的角色分別跑一遍。取樣器、設定集和記憶設定在每個模型間都能通用,自訂提示詞還能把 4.6 往更強的推進力推,或把 4.8 往更深的情感推。小提示:每個模型都要在你用完它之後、下一個模型還沒讓你眼花撩亂之前立刻打分,這是唯一能抓住一個全新模型到底缺了什麼的辦法。
Nevika 接受任意 OpenAI 相容端點作為自訂代理。這裡給出一分鐘的設定流程、該挑哪個模型,以及大家最常撞到的兩個錯誤。
SpicyChat 是一個零設定的角色扮演網站,它的記憶和上下文被關在付費級距後面。UnoRouter 保留了輕鬆的起步,但加上 200+ 個由你挑的模型、深度的 lorebooks,還有一把也能跑編碼代理的金鑰。
Agnai 是一個開源角色扮演前端,它的亮點是真正的多人:好幾個真人和好幾個機器人共處一場聊天。UnoRouter 有託管的單人角色扮演深度,這裡金鑰就是帳號,而且還能跑編碼代理。