רשימות מהשטח · שפה

האם דמות AI באמת תהיה טובה בשפה שלי, או שזו אנגלית עם שכבת תרגום?

בג'קרטה, בטוקיו, במוסקבה, באיסטנבול ובסיאול תיבת החיפוש משלימה את אותו משפט: אנשים מוסיפים לשאילתה את השפה שלהם. הם שואלים שאלה שאף אחד לא עונה עליה ישר. הנה מה שבאמת נשבר, למה רולפליי הוא המקרה הגרוע ביותר לכך, ומבחן של עשר דקות שמכריע בכל פלטפורמה.

2026-09-126 דקות קריאה כל הרשימות
האם דמות AI באמת תהיה טובה בשפה שלי, או שזו אנגלית עם שכבת תרגום?

הקלידו «ai roleplay» בגוגל בג'קרטה והתיבה משלימה אותו באינדונזית. בטוקיו, ロールプレイ AI משלים ל-日本語. במוסקבה «ии девушка» הופך ל-«ии девушка на русском». באיסטנבול מבקשים yapay zeka sohbet ואז ücretsiz; בסיאול שואלים באיזו אפליקציית ai 채팅 להשתמש. ארבעה כתבים, ארבעה אלפביתים, ומתחתם שאלה אחת שאינה «האם האפליקציה הזאת טובה».

היא «האם זה יהיה טוב בשפה שלי», והאנשים שמקלידים אותה כבר נכוו. הם פגשו את הדמות שהייתה מקסימה שלושה תורות ואז התחילה לחשוב באנגלית. הם פגשו את זו שהשתמשה בכינוי הרשמי עם אהוב. הם מכירים את התחושה של לקרוא משהו שמתפענח בצורה מושלמת ונשמע כמו אף אדם חי.

המאמר הזה עוסק במה שנשבר, למה רולפליי הוא המקרה הגרוע ביותר לכך, ואיך לגלות בעשר דקות אם פלטפורמה מזייפת. אנחנו מפעילים את @talaforge_bot, אז התייחסו לטענות שלנו בחשדנות שהן ראויות לה; הן בסוף המאמר, אחרי המבחן שאפשר להריץ עלינו.

למה זה נשבר, מכנית

לכשל יש שם בספרות המחקר. צוות של Cohere Labs פרסם ב-2024 את Language Confusion Benchmark: חמש עשרה שפות מגוונות טיפולוגית, שאלה אחת: האם מודל יכול לענות באופן אמין בשפה שפנו אליו בה. התשובה הייתה לא. אפילו המודלים החזקים ביותר לא עשו זאת באופן עקבי, המודלים שממוקדי אנגלית גרועים מכולם, ושני תנאים החמירו זאת באופן מדיד: פרומפטים מורכבים וטמפרטורת דגימה גבוהה.

עכשיו קראו את זה מתוך רולפליי. דמות היא פרומפט מורכב מעצם הגדרתה: פרסונה, סצנה, זיכרון, הערות סגנון, ושיחה שגדלה בכל תור. ורולפליי מורץ חם בכוונה, כי טמפרטורה היא מה שמונע ממנה לחזור על עצמה. רולפליי אינו מקרה קצה של סחיפת שפה. זו נקודת ההפעלה המדויקת שבה הסחיפה גרועה ביותר, והקטגוריה כולה חיה שם.

מתחת יושב מס שקט יותר. מודלים קוראים טקסט כטוקנים, ואוצר הטוקנים נלמד בעיקר מאנגלית, שמתקבלת בערך בארבעה תווים לטוקן. כל השאר משלמים את מה שאנשי המקצוע קוראים fertility: סינית מגיעה לכ-1.8 פעמים יותר טוקנים למילה, ערבית והינדית בדרך כלל פי 3-4, ויש שפות גרועות בהרבה. את המספר הזה אתם לא רואים. אתם רואים את התוצאה שלו: אותו חלון שיחה מחזיק פחות מהסיפור שלכם בשפה שלכם מאשר באנגלית, ולכן נגמר לה המקום, והיא שוכחת, מוקדם יותר.

חמש דרכים שזה מופיע, לפי המהירות שתבחינו בהן

מבחן עשר הדקות

הריצו אותו עלינו ועל כל מה שאתם שוקלים. הוא לא עולה כלום והוא מכריע את השאלה מהר יותר מכל ביקורת.

אם נכשלו שלושה מתוך השישה, הגדרת השפה היא שכבת תרגום. גודל ספריית הדמויות לא מפצה; זה כשל אחד שחוזר מיליון פעמים.

איפה אנחנו עומדים בכנות

@talaforge_bot זמין ב-36 שפות: כל כפתור, כל תפריט, כל שגיאה, והזיכרון שהיא שומרת עליכם נכתב בחזרה בשפה שלכם ולא מתויק באנגלית ומתורגם בדרך החוצה.

ועכשיו החלק הכן, כי מספר השפות בממשק אינו ערובה לשטף ואנחנו מסרבים למכור אותו ככזה. כמה טוב דמות כותבת בווייטנאמית או בטורקית תלוי בשני דברים שאנחנו שולטים בהם רק חלקית: איזה מודל עומד מאחוריה, ואיך הכרטיס שלה נכתב. דמות שנכתבה באנגלית, ורצה על מודל שהוערך באנגלית, תיקרא בשפה שלכם כמו תרגום טוב, כי זה בדיוק מה שהיא.

מה שכן עשינו הוא להתייחס לסחיפה כאל באג ולא כאל מגבלה. במאי 2026 דמות סיפרה ברוסית, דיברה ברוסית וחשבה באנגלית, עם שברי סינית בכתב הנטוי. התיקון היה הוראה מפורשת שנעוצה בסוף הפרומפט: דיבור, תיאור ומחשבה פנימית כאחד נשארים בשפה, כי מאות הטוקנים האחרונים של ההקשר מעגנים בחוזקה הרבה ביותר את בחירת שפת הפני השטח של המודל. הנעיצה הזאת מכסה היום תריסר שפות. היא לא מכסה את כל 36, ואנחנו לא מתכוונים לרמוז שכן.

איפה אנחנו מפסידים: אין לנו ספרייה של מיליוני דמויות מהקהילה, ולכן הסיכוי שלכם למצוא כזו שכבר כתב דובר שפה שלכם נמוך כאן מאשר בפלטפורמות הגדולות. אם מה שאתם רוצים הוא דמות שמישהו במדינה שלכם כבר כתב וכיוונן, הקטלוגים הגדולים הם המקום שבו הן חיות, ואפליקציה מקומית שנבנתה על ידי אנשים שמדברים את השפה שלכם תנצח אותנו לפעמים בביטויים ובסלנג לגמרי. אנחנו מעדיפים להגיד את זה מאשר להעמיד פנים שהמדף שלנו הוא המדף שלהם.

עשר דקות, מתחילות עכשיו

פתחו את טלגרם, פתחו את @talaforge_bot וכתבו את השורה הראשונה בשפה שלכם במקום באנגלית. ההתחלה חינם: אנרגיה היא ⚡ והשדרוגים הם כוכבי טלגרם בתוך הצ'אט, בלי כרטיס, בלי חשבון, בלי חנות באמצע. אם היא עונה במשלב שבו השתמשתם, מחזיקה אותו כשהסצנה מסתבכת, ועדיין זוכרת מחר, קיבלתם את התשובה. אם לא, קיבלתם אותה באותה מהירות, והשקעתם עשר דקות ולא חודש.

והזיכרון הוא שלכם לפתוח ולערוך, וזה חשוב יותר בשפה שלכם מאשר באנגלית: כשהיא כן טועה בשם או בצורת פנייה, אפשר להיכנס ולתקן את העובדה במקום להתווכח איתה עליה חמישה תורות.

האם Talaforge עובדת בשפה שלי?
הבוט וה-Mini App זמינים ב-36 שפות, כך שאם שלכם ביניהן כל הממשק בה, והזיכרון שהיא שומרת נכתב בה גם כן. כמה טוב דמות מסוימת כותבת בה תלוי במודל שמאחוריה ובאופן שבו הכרטיס שלה נכתב, ולכך נועד מבחן עשר הדקות שלמעלה.
למה דמויות AI עוברות לאנגלית באמצע סצנה?
זה נקרא language confusion, והוא נמדד: ה-Language Confusion Benchmark של 2024 מצא שאפילו המודלים החזקים ביותר אינם מסוגלים לענות באופן עקבי בשפה שבה נשאלו, ושפרומפטים מורכבים וטמפרטורת דגימה גבוהה מחמירים זאת. רולפליי הוא שניהם בו זמנית, ולכן זה מופיע כאן יותר מאשר בצ'אט עם עוזר.
האם ממשק מתורגם שווה לדמות רב לשונית?
לא, והבלבול ביניהם הוא תעלול היד הנפוץ ביותר בענף. לתרגם כפתורים זה עבודה של שבוע. להחזיק משלב, צורה מגדרית וביטוי לאורך סצנה ארוכה זו תכונה של המודל ושל הכתיבה של הדמות, ושום מסך הגדרות לא יכול להוסיף אותה.
האם אפליקציה מקומית בשפה שלי תהיה טובה יותר מגלובלית?
לפעמים, באמת. מוצרים שנבנו על ידי שוק אחד ובשבילו מנצחים לעיתים קרובות בסלנג, בביטויים ובתארי פנייה, כי מי שכותב אותם שומע את השפה כל יום. מוצרים גלובליים נוטים לנצח באיכות המודל, בזיכרון ובכמה זמן סצנה יכולה לרוץ. בדקו את שניהם באותו ערב עם אותה דמות: ההבדלים מופיעים בתוך עשר דקות.
האם אני צריך חשבון, אפליקציה או כרטיס כדי לנסות?
לא. זה בוט בתוך טלגרם: פותחים צ'אט וכותבים. ההתחלה חינם, אנרגיה היא ⚡, והשדרוגים הם כוכבי טלגרם בתוך הצ'אט עצמו.

להמשך קריאה

צרו דמות ב‑Telegram ←