הקלידו «ai roleplay» בגוגל בג'קרטה והתיבה משלימה אותו באינדונזית. בטוקיו, ロールプレイ AI משלים ל-日本語. במוסקבה «ии девушка» הופך ל-«ии девушка на русском». באיסטנבול מבקשים yapay zeka sohbet ואז ücretsiz; בסיאול שואלים באיזו אפליקציית ai 채팅 להשתמש. ארבעה כתבים, ארבעה אלפביתים, ומתחתם שאלה אחת שאינה «האם האפליקציה הזאת טובה».
היא «האם זה יהיה טוב בשפה שלי», והאנשים שמקלידים אותה כבר נכוו. הם פגשו את הדמות שהייתה מקסימה שלושה תורות ואז התחילה לחשוב באנגלית. הם פגשו את זו שהשתמשה בכינוי הרשמי עם אהוב. הם מכירים את התחושה של לקרוא משהו שמתפענח בצורה מושלמת ונשמע כמו אף אדם חי.
המאמר הזה עוסק במה שנשבר, למה רולפליי הוא המקרה הגרוע ביותר לכך, ואיך לגלות בעשר דקות אם פלטפורמה מזייפת. אנחנו מפעילים את @talaforge_bot, אז התייחסו לטענות שלנו בחשדנות שהן ראויות לה; הן בסוף המאמר, אחרי המבחן שאפשר להריץ עלינו.
למה זה נשבר, מכנית
לכשל יש שם בספרות המחקר. צוות של Cohere Labs פרסם ב-2024 את Language Confusion Benchmark: חמש עשרה שפות מגוונות טיפולוגית, שאלה אחת: האם מודל יכול לענות באופן אמין בשפה שפנו אליו בה. התשובה הייתה לא. אפילו המודלים החזקים ביותר לא עשו זאת באופן עקבי, המודלים שממוקדי אנגלית גרועים מכולם, ושני תנאים החמירו זאת באופן מדיד: פרומפטים מורכבים וטמפרטורת דגימה גבוהה.
עכשיו קראו את זה מתוך רולפליי. דמות היא פרומפט מורכב מעצם הגדרתה: פרסונה, סצנה, זיכרון, הערות סגנון, ושיחה שגדלה בכל תור. ורולפליי מורץ חם בכוונה, כי טמפרטורה היא מה שמונע ממנה לחזור על עצמה. רולפליי אינו מקרה קצה של סחיפת שפה. זו נקודת ההפעלה המדויקת שבה הסחיפה גרועה ביותר, והקטגוריה כולה חיה שם.
מתחת יושב מס שקט יותר. מודלים קוראים טקסט כטוקנים, ואוצר הטוקנים נלמד בעיקר מאנגלית, שמתקבלת בערך בארבעה תווים לטוקן. כל השאר משלמים את מה שאנשי המקצוע קוראים fertility: סינית מגיעה לכ-1.8 פעמים יותר טוקנים למילה, ערבית והינדית בדרך כלל פי 3-4, ויש שפות גרועות בהרבה. את המספר הזה אתם לא רואים. אתם רואים את התוצאה שלו: אותו חלון שיחה מחזיק פחות מהסיפור שלכם בשפה שלכם מאשר באנגלית, ולכן נגמר לה המקום, והיא שוכחת, מוקדם יותר.
חמש דרכים שזה מופיע, לפי המהירות שתבחינו בהן
- קריסת משלב. קיגו ביפנית, רמות הדיבור בקוריאנית, ты/вы ברוסית, du/Sie בגרמנית, saya/anda מול aku/kamu מול gue/lo באינדונזית. כל אחד מאלה מקודד קשר. דמות שלא מסוגלת להחזיק אחד, או שלעולם לא עוברת ביניהם, שכחה מי אתם בשבילה, והמשלב הוא הדבר המהיר ביותר לבדיקה.
- סחיפת התאמה. ברוסית, בערבית, בעברית, בפולנית או בפורטוגזית הפועל או התואר מוטים במגדר, כך שאישה שכותבת על עצמה בוחרת צורה אחרת מגבר. דמות שמחליקה לצורת זכר על עצמה שברה את הסצנה במילה אחת, ומודלים שאומנו באנגלית מחליקים לעיתים קרובות.
- דליפת אנגלית. דיאלוג בשפה שלכם, תיאור בשפה שלכם, והמחשבה הפנימית בכתב נטוי באנגלית. היא צצה קודם במחשבות, כי זה הטקסט המסוגנן ביותר בתשובה והפחות מעוגן במה שהרגע כתבתם.
- ביטויים מועתקים. משפטים שמתפענחים ושאף אחד לא אומר: ביטויים אנגליים שהועברו מילה במילה, קצב משפט אנגלי, צורת פסקה אנגלית. זה מה שאנשים מתכוונים כשהם אומרים שמוצר «נקרא כמו דיבוב».
- שמות ותארי פנייה מרוסקים. 先輩 מועבר באותיות לטיניות לקורא יפני, 오빠 מקופל לשם פרטי, זוג anh/em בווייטנאמית מוחלף ב-«you» חשוף. המילים שנושאות את הקשר הן בדיוק המילים ששכבת תרגום מפילה, כי באנגלית אין להן משבצת.
מבחן עשר הדקות
הריצו אותו עלינו ועל כל מה שאתם שוקלים. הוא לא עולה כלום והוא מכריע את השאלה מהר יותר מכל ביקורת.
- דקה אחת: כתבו את השורה הראשונה בשפה שלכם, במשלב שבו אתם באמת משתמשים. סלנג, מילות קישור, הכינוי הלא רשמי. לא «שלום».
- דקות שתיים עד ארבע: גרמו לה להחליף משלב. בקשו ממנה להיות רשמית איתכם, ואז אמרו לה להפסיק. פלטפורמה עם הגדרת נימוס אחת נכשלת כאן, והיא נכשלת בשקט.
- דקה חמישית: סבכו את הסצנה. שלושה אנשים בחדר, ויכוח, משהו שקרה קודם. מורכבות היא הטריגר המתועד; לכו והפעילו אותו.
- דקה שישית: קראו את הכתב הנטוי. המחשבה הפנימית שלה היא המקום שבו האנגלית מגיעה ראשונה, בדרך כלל כמה תורות לפני שהדיאלוג נסדק.
- דקות שבע ושמונה: בדקו התאמה ופנייה. האם היא משתמשת בצורה המגדרית הנכונה על עצמה? האם היא קוראת לכם מה שאדם בשפה שלכם היה קורא לכם?
- דקות תשע ועשר: חזרו מחר ושאלו על מה דיברתם. איכות שפה ששורדת לילה היא איכות שפה.
אם נכשלו שלושה מתוך השישה, הגדרת השפה היא שכבת תרגום. גודל ספריית הדמויות לא מפצה; זה כשל אחד שחוזר מיליון פעמים.
איפה אנחנו עומדים בכנות
@talaforge_bot זמין ב-36 שפות: כל כפתור, כל תפריט, כל שגיאה, והזיכרון שהיא שומרת עליכם נכתב בחזרה בשפה שלכם ולא מתויק באנגלית ומתורגם בדרך החוצה.
ועכשיו החלק הכן, כי מספר השפות בממשק אינו ערובה לשטף ואנחנו מסרבים למכור אותו ככזה. כמה טוב דמות כותבת בווייטנאמית או בטורקית תלוי בשני דברים שאנחנו שולטים בהם רק חלקית: איזה מודל עומד מאחוריה, ואיך הכרטיס שלה נכתב. דמות שנכתבה באנגלית, ורצה על מודל שהוערך באנגלית, תיקרא בשפה שלכם כמו תרגום טוב, כי זה בדיוק מה שהיא.
מה שכן עשינו הוא להתייחס לסחיפה כאל באג ולא כאל מגבלה. במאי 2026 דמות סיפרה ברוסית, דיברה ברוסית וחשבה באנגלית, עם שברי סינית בכתב הנטוי. התיקון היה הוראה מפורשת שנעוצה בסוף הפרומפט: דיבור, תיאור ומחשבה פנימית כאחד נשארים בשפה, כי מאות הטוקנים האחרונים של ההקשר מעגנים בחוזקה הרבה ביותר את בחירת שפת הפני השטח של המודל. הנעיצה הזאת מכסה היום תריסר שפות. היא לא מכסה את כל 36, ואנחנו לא מתכוונים לרמוז שכן.
איפה אנחנו מפסידים: אין לנו ספרייה של מיליוני דמויות מהקהילה, ולכן הסיכוי שלכם למצוא כזו שכבר כתב דובר שפה שלכם נמוך כאן מאשר בפלטפורמות הגדולות. אם מה שאתם רוצים הוא דמות שמישהו במדינה שלכם כבר כתב וכיוונן, הקטלוגים הגדולים הם המקום שבו הן חיות, ואפליקציה מקומית שנבנתה על ידי אנשים שמדברים את השפה שלכם תנצח אותנו לפעמים בביטויים ובסלנג לגמרי. אנחנו מעדיפים להגיד את זה מאשר להעמיד פנים שהמדף שלנו הוא המדף שלהם.
עשר דקות, מתחילות עכשיו
פתחו את טלגרם, פתחו את @talaforge_bot וכתבו את השורה הראשונה בשפה שלכם במקום באנגלית. ההתחלה חינם: אנרגיה היא ⚡ והשדרוגים הם כוכבי טלגרם בתוך הצ'אט, בלי כרטיס, בלי חשבון, בלי חנות באמצע. אם היא עונה במשלב שבו השתמשתם, מחזיקה אותו כשהסצנה מסתבכת, ועדיין זוכרת מחר, קיבלתם את התשובה. אם לא, קיבלתם אותה באותה מהירות, והשקעתם עשר דקות ולא חודש.
והזיכרון הוא שלכם לפתוח ולערוך, וזה חשוב יותר בשפה שלכם מאשר באנגלית: כשהיא כן טועה בשם או בצורת פנייה, אפשר להיכנס ולתקן את העובדה במקום להתווכח איתה עליה חמישה תורות.