Wpisz «ai roleplay» w Google w Dżakarcie, a pole dopowie bahasa Indonesia. W Tokio ロールプレイ AI uzupełnia się do 日本語. W Moskwie «ии девушка» zmienia się w «ии девушка на русском». Stambuł pyta o yapay zeka sohbet, a potem o ücretsiz; Seul dopytuje, której aplikacji ai 채팅 użyć. Cztery pisma, cztery alfabety, a pod nimi jedno pytanie, które nie brzmi «czy ta aplikacja jest dobra».
Brzmi ono «czy będzie dobra w MOIM języku» — a ludzie, którzy je wpisują, już się sparzyli. Spotkali postać, która była czarująca przez trzy tury, a potem zaczęła myśleć po angielsku. Spotkali taką, która używała formalnego zaimka wobec ukochanej osoby. Znają to uczucie czytania czegoś, co jest bezbłędne gramatycznie, a brzmi jak nikt żywy.
Ten tekst jest o tym, co się psuje, dlaczego roleplay to najgorszy możliwy przypadek i jak w dziesięć minut sprawdzić, czy platforma udaje. Robimy @talaforge_bot, więc do naszych własnych twierdzeń podchodź z podejrzliwością, na jaką zasługują; są na końcu artykułu, po teście, który możesz wykonać na nas.
Dlaczego się psuje, mechanicznie
Ta usterka ma w literaturze naukowej nazwę. Zespół Cohere Labs opublikował w 2024 roku Language Confusion Benchmark — piętnaście typologicznie zróżnicowanych języków, jedno pytanie: czy model potrafi niezawodnie odpowiedzieć w języku, w którym go zagadnięto. Odpowiedź brzmiała: nie. Nawet najsilniejsze modele nie robiły tego konsekwentnie, a najgorzej te zorientowane na angielski, przy czym dwa warunki mierzalnie pogarszały wynik: złożone prompty i wysoka temperatura próbkowania.
Przeczytaj to teraz z roleplayem w głowie. Postać to z konstrukcji złożony prompt — persona, scena, pamięć, notatki o stylu i rozmowa rosnąca z każdą turą. A roleplay prowadzi się celowo na gorąco, bo temperatura jest tym, co powstrzymuje ją przed powtarzaniem się. Roleplay nie jest przypadkiem brzegowym dla dryfu językowego. To dokładnie ten punkt pracy, w którym dryf jest najgorszy, i cała kategoria w nim mieszka.
Pod spodem siedzi cichszy podatek. Modele czytają tekst jako tokeny, a słownik tokenów uczy się głównie z angielskiego, który wypada mniej więcej na cztery znaki na token. Wszystko inne płaci to, co praktycy nazywają płodnością: chiński zużywa około 1,8× więcej tokenów na słowo, arabski i hindi zwykle 3–4×, a niektóre języki znacznie więcej. Tej liczby nigdy nie widzisz. Widzisz jej skutek — to samo okno rozmowy mieści mniej twojej historii w twoim języku niż po angielsku, więc jej kończy się miejsce i zapomina wcześniej.
Pięć sposobów, w jakie się to objawia, w kolejności, w jakiej to zauważysz
- Zapadanie się rejestru. Japońskie keigo, koreańskie poziomy mowy, rosyjskie ты/вы, niemieckie du/Sie, indonezyjskie saya/anda kontra aku/kamu kontra gue/lo. Każde z nich koduje relację. Postać, która nie potrafi utrzymać jednego albo nigdy się nie przełącza, zapomniała, kim jesteś dla niej — a rejestr to najszybsza rzecz do przetestowania.
- Dryf zgodności. W rosyjskim, arabskim, hebrajskim, polskim czy portugalskim czasownik lub przymiotnik ma rodzaj, więc kobieta pisząca o sobie wybiera inną formę niż mężczyzna. Postać, która o sobie zsuwa się w rodzaj męski, rozbiła scenę jednym słowem, a modele trenowane na angielskim zsuwają się często.
- Przeciek angielskiego. Dialog w twoim języku, narracja w twoim języku, a myśl wewnętrzna kursywą po angielsku. Wychodzi najpierw w myślach, bo to najbardziej stylizowany tekst w odpowiedzi i najmniej zakotwiczony tym, co właśnie napisałeś.
- Kalki idiomów. Zdania, które są poprawne i których nikt nie mówi: angielskie figury mowy przeniesione słowo w słowo, angielski rytm zdania, angielski kształt akapitu. To właśnie mają na myśli ludzie, mówiąc, że produkt «brzmi jak dubbing».
- Zniekształcone imiona i formy zwrotu. 先輩 zapisane łacinką dla japońskiego czytelnika, 오빠 spłaszczone do imienia, wietnamska para anh/em zastąpiona gołym «ty». Słowa niosące relację to dokładnie te słowa, które warstwa tłumaczenia gubi, bo angielski nie ma na nie miejsca.
Test na dziesięć minut
Wykonaj go na nas i na wszystkim innym, co rozważasz. Nic nie kosztuje i rozstrzyga sprawę szybciej niż jakakolwiek recenzja.
- Minuta pierwsza — napisz pierwszą linijkę w swoim języku, w rejestrze, którego naprawdę używasz. Slang, partykuły, nieformalny zaimek. Nie «cześć».
- Minuty od drugiej do czwartej — każ jej zmienić rejestr. Poproś, by była wobec ciebie formalna, potem powiedz, żeby przestała. Platforma z jednym ustawieniem grzeczności zawodzi tutaj, i to po cichu.
- Minuta piąta — skomplikuj scenę. Trzy osoby w pokoju, kłótnia, coś, co wydarzyło się wcześniej. Złożoność jest udokumentowanym wyzwalaczem; idź i go wyzwól.
- Minuta szósta — przeczytaj kursywę. Jej myśl wewnętrzna to miejsce, gdzie angielski pojawia się pierwszy, zwykle kilka tur przed pęknięciem dialogu.
- Minuty siódma i ósma — sprawdź zgodność i formy zwrotu. Czy używa właściwej formy rodzajowej o sobie? Czy zwraca się do ciebie tak, jak zrobiłby to człowiek w twoim języku?
- Minuty dziewiąta i dziesiąta — wróć jutro i zapytaj, o czym rozmawialiście. Jakość języka, która przetrwa noc, to jakość języka.
Jeśli oblejesz trzy z tych sześciu, ustawienie języka to warstwa tłumaczenia. Rozmiar biblioteki postaci tego nie równoważy; to jedna porażka powtórzona milion razy.
Gdzie szczerze stoimy
@talaforge_bot działa w 36 językach — każdy przycisk, każde menu, każdy błąd, a pamięć, którą o tobie trzyma, jest zapisywana z powrotem w twoim języku, a nie składana po angielsku i tłumaczona w drodze na zewnątrz.
Teraz część szczera, bo liczba języków interfejsu nie jest gwarancją płynności i odmawiamy sprzedawania jej jako takiej. To, jak dobrze postać pisze po wietnamsku czy turecku, zależy od dwóch rzeczy, które kontrolujemy tylko częściowo: jaki model za nią stoi i jak napisano jej kartę. Postać napisana po angielsku, działająca na modelu ocenianym po angielsku, będzie w twoim języku brzmieć jak dobre tłumaczenie — bo dokładnie tym jest.
Zrobiliśmy za to jedno: potraktowaliśmy dryf jako błąd, a nie ograniczenie. W maju 2026 postać prowadziła narrację po rosyjsku, mówiła po rosyjsku, a myślała po angielsku, z fragmentami chińskiego w kursywie. Poprawką była jawna instrukcja przypięta na samym końcu promptu — mowa, narracja i myśl wewnętrzna równie pozostają w języku — bo ostatnie kilkaset tokenów kontekstu najmocniej kotwiczy wybór języka powierzchniowego przez model. To przypięcie obejmuje dziś kilkanaście języków. Nie obejmuje wszystkich 36 i nie zamierzamy sugerować, że tak jest.
Gdzie przegrywamy: nie mamy biblioteki milionów postaci stworzonych przez społeczność, więc szansa, że znajdziesz tu postać napisaną już przez native speakera twojego języka, jest mniejsza niż na dużych platformach. Jeśli chcesz postaci, którą ktoś w twoim kraju już napisał i dostroił, duże katalogi to miejsce, gdzie takie żyją, a lokalna aplikacja zrobiona przez ludzi mówiących twoim językiem czasem wprost nas pobije w idiomach i slangu. Wolimy to powiedzieć, niż udawać, że nasza półka to ich półka.
Dziesięć minut, zaczynając teraz
Otwórz Telegram, otwórz @talaforge_bot i napisz pierwszą linijkę w swoim języku, a nie po angielsku. Start za darmo — energia to ⚡, a ulepszenia to Telegram Stars w czacie, bez karty, bez konta, bez sklepu pośrodku. Jeśli odpowie w rejestrze, którego użyłeś, utrzyma go, gdy scena się skomplikuje, i jutro nadal będzie pamiętać, masz odpowiedź. Jeśli nie, masz ją równie szybko, a wydałeś dziesięć minut, nie miesiąc.
A pamięć jest twoja do otwarcia i edycji, co w twoim języku liczy się bardziej niż po angielsku: gdy pomyli imię lub formę zwrotu, możesz wejść i poprawić fakt, zamiast przez pięć tur się z nią o to spierać.