在雅加達的 Google 打「ai roleplay」,搜尋框會用 bahasa Indonesia 幫你補完。在東京,ロールプレイ AI 後面接的是 日本語。在莫斯科,「ии девушка」變成「ии девушка на русском」。伊斯坦堡接著問 yapay zeka sohbet,然後是 ücretsiz;首爾問的是該用哪個 ai 채팅 앱。四種文字、四套字母,底下是同一個問題,而那不是「這個 App 好不好」。
那個問題是「在我的語言裡,它會好用嗎」——而打出這個問題的人,早就被燒過了。他們遇過那個前三輪很迷人、接著開始用英文思考的角色。他們遇過對戀人用敬稱代名詞的那一個。他們知道讀一段語法完全沒問題、卻不像任何活人說出來的文字,是什麼感覺。
這篇文章講的是什麼會壞掉、為什麼角色扮演是最糟糕的情境,以及如何在十分鐘內看出一個平台是不是在假裝。我們做的是 @talaforge_bot,所以請用我們自己的說法應得的懷疑去看待它們;它們在文章最後,排在你可以拿我們來跑的測試之後。
為什麼會壞:從機制來看
這種失敗在研究文獻裡有名字。Cohere Labs 的團隊在 2024 年發表了 Language Confusion Benchmark——十五種類型各異的語言,一個問題:模型能否穩定地用被詢問的那種語言回答。答案是不能。即使是最強的模型也無法一致地做到,以英文為中心的模型尤其差,而且有兩個條件會讓情況明顯惡化:複雜的提示詞,以及高取樣溫度。
現在帶著角色扮演去讀這段。角色就其構造而言就是一個複雜的提示詞——人設、場景、記憶、風格註記,外加一段每一輪都在變長的對話。而角色扮演是刻意調高溫度來跑的,因為溫度正是讓她不要重複自己的東西。角色扮演不是語言漂移的邊緣案例。它正好是漂移最嚴重的運作點,而整個品類就住在那裡。
底下還有一筆更安靜的稅。模型把文字讀成 token,而 token 的詞彙表大多是從英文學來的,大約是一個 token 四個字元。其他語言都要付實務界所謂的 fertility:中文每個詞大約是 1.8× 的 token,阿拉伯文和印地文通常是 3–4×,有些語言更糟得多。你永遠看不到這個數字。你看到的是它的後果——同樣大小的對話視窗,用你的語言能裝下的故事比用英文少,所以她更快用完空間,也更快遺忘。
五種表現,依你多快會注意到排序
- 語氣層級崩壞。日文敬語、韓文的說話層級、俄文 ты/вы、德文 du/Sie、印尼文 saya/anda 對 aku/kamu 對 gue/lo。每一個都編碼了一段關係。一個守不住某個層級、或是從不切換的角色,已經忘記你之於她是誰——而語氣層級是最快能測的一項。
- 詞性一致性漂移。在俄文、阿拉伯文、希伯來文、波蘭文或葡萄牙文裡,動詞或形容詞有性別,所以一個女人寫自己時選的形式和男人不同。一個在講自己時滑進陽性的角色,一個字就打破了場景,而以英文訓練的模型常常滑。
- 英文滲入。對白用你的語言,旁白用你的語言,斜體的內心想法卻是英文。它最先出現在想法裡,因為那是回覆中最風格化、也最不受你剛打的字錨定的文字。
- 照字面搬過來的慣用語。句子讀得通,卻沒有人這樣說:英文的比喻逐字搬過來、英文的句子節奏、英文的段落形狀。人們說一個產品「讀起來像配音版」,指的就是這個。
- 被弄壞的名字與稱呼。給日文讀者的 先輩 被寫成拉丁字母,오빠 被壓扁成一個名字,越南文的 anh/em 配對被換成一個乾巴巴的「you」。承載關係的字詞,正是翻譯層會丟掉的字詞,因為英文裡沒有位置放它們。
十分鐘測試
拿這個測試跑我們,也跑你正在考慮的其他任何東西。它不花錢,而且比任何評論都更快解決這個問題。
- 第一分鐘——用你的語言寫第一句話,用你平常真的會用的語氣。俚語、語助詞、非正式的代名詞。不是「你好」。
- 第二到第四分鐘——讓她切換語氣。要她對你正式一點,再叫她放掉。只有一種禮貌設定的平台會在這裡失敗,而且是無聲地失敗。
- 第五分鐘——把場景弄複雜。房間裡三個人、一場爭吵、先前發生過的事。複雜度是有文獻記載的觸發條件;去觸發它。
- 第六分鐘——讀斜體。她的內心想法是英文最先抵達的地方,通常比對白出現裂縫早好幾輪。
- 第七、第八分鐘——檢查一致性與稱呼。她講自己時用對性別形式了嗎?她對你的稱呼是你的語言裡真人會用的嗎?
- 第九、第十分鐘——明天再回來,問她你們聊了什麼。能撐過一夜的語言品質,才是語言品質。
這六項裡有三項沒過,語言設定就只是一層翻譯層。角色庫的大小補不回來;那只是同一個失敗被重複了一百萬次。
我們老實說的立場
@talaforge_bot 支援 36 種語言——每個按鈕、每個選單、每則錯誤訊息,而她為你保留的記憶是用你的語言寫回去的,不是先用英文歸檔、出來時再翻譯。
接著是老實的部分,因為介面的語言數量不等於流暢度保證,我們也拒絕那樣賣。一個角色用越南文或土耳其文寫得多好,取決於兩件我們只能部分掌控的事:她背後是哪個模型,以及她的角色卡怎麼寫。一個用英文創作、跑在用英文評估過的模型上的角色,讀起來會像一篇好翻譯——因為那正是它的本質。
我們真正做的,是把漂移當成一個 bug,而不是一個限制。2026 年 5 月,有個角色用俄文旁白、用俄文說話、卻用英文思考,斜體裡還夾著幾段中文。修法是在提示詞的最末端釘上一條明確指示——對白、旁白和內心想法一律維持在該語言——因為上下文最後的幾百個 token 對模型表層語言選擇的錨定最強。這個釘選今天涵蓋十幾種語言。它沒有涵蓋全部 36 種,而我們不打算暗示它有。
我們輸的地方:我們沒有數百萬個社群創作角色的資料庫,所以在這裡找到一個已經由你的語言母語者寫好的角色,機會比在大型平台上低。如果你要的是你國家的某個人已經寫好、調好的角色,大型目錄就是那些角色所在的地方,而由說你的語言的人做的在地 App,有時在慣用語和俚語上會直接贏過我們。我們寧可這樣說,也不假裝我們的架子就是他們的架子。
十分鐘,現在開始
打開 Telegram,打開 @talaforge_bot,第一句話用你自己的語言寫,而不是英文。免費開始——能量是 ⚡,升級是聊天裡的 Telegram Stars,沒有信用卡、沒有帳號、中間沒有任何商店。如果她用你寫的語氣回答、場景變複雜時還能撐住、而且明天還記得,你就有答案了。如果她沒有,你同樣很快就有答案,而你花的是十分鐘,不是一個月。
而且記憶是你的,可以打開、可以編輯,這在你的語言裡比在英文裡更重要:當她真的弄錯了名字或稱呼,你可以進去直接修正那筆事實,而不是和她爭論五輪。