जकार्तामध्ये गुगलवर «ai roleplay» टाइप करा आणि चौकट ते bahasa Indonesia ने पूर्ण करते. टोकियोमध्ये ロールプレイ AI चे 日本語 होते. मॉस्कोमध्ये «ии девушка» चे «ии девушка на русском» होते. इस्तंबूल yapay zeka sohbet आणि मग ücretsiz मागते; सोल कोणते ai 채팅 앱 वापरायचे ते विचारते. चार लिप्या, चार वर्णमाला, आणि त्या सर्वांच्या खाली एकच प्रश्न जो «हे अॅप चांगले आहे का» हा नाही.
तो आहे «माझ्या भाषेत हे चांगले असेल का» — आणि तो टाइप करणारे लोक आधीच भाजलेले आहेत. त्यांनी तीन फेऱ्या मोहक असलेले, आणि मग इंग्रजीत विचार करायला लागलेले पात्र पाहिले आहे. प्रियकराशी औपचारिक सर्वनाम वापरणारे पात्र पाहिले आहे. नीट पार्स होणारे पण कोणत्याही जिवंत माणसासारखे न वाटणारे काहीतरी वाचण्याची भावना त्यांना माहीत आहे.
हा लेख काय बिघडते, रोलप्ले हा त्यासाठी सर्वात वाईट संभाव्य प्रसंग का आहे, आणि एखादा प्लॅटफॉर्म नाटक करतो आहे का हे दहा मिनिटांत कसे कळते याबद्दल आहे. @talaforge_bot आम्ही बनवतो, त्यामुळे आमच्या स्वतःच्या दाव्यांकडे ते पात्र असलेल्या संशयाने पाहा; ते लेखाच्या शेवटी आहेत, आमच्यावर चालवता येणाऱ्या चाचणीनंतर.
हे बिघडते कसे, यांत्रिक पातळीवर
या अपयशाला संशोधन साहित्यात नाव आहे. Cohere Labs च्या एका संघाने 2024 मध्ये Language Confusion Benchmark प्रकाशित केला — पंधरा रचनात्मकदृष्ट्या वैविध्यपूर्ण भाषा, एक प्रश्न: ज्या भाषेत संबोधले गेले त्याच भाषेत मॉडेल विश्वासाने उत्तर देऊ शकते का. उत्तर नाही असे होते. सर्वात सक्षम मॉडेलही हे सातत्याने करू शकले नाहीत, इंग्रजी-केंद्रित मॉडेल सर्वात वाईट, आणि दोन परिस्थितींनी ते मोजता येण्याइतके बिघडवले: गुंतागुंतीचे प्रॉम्प्ट्स आणि उच्च सॅम्पलिंग टेम्परेचर.
आता हे रोलप्ले डोळ्यांसमोर ठेवून वाचा. पात्र हे रचनेनेच गुंतागुंतीचा प्रॉम्प्ट असते — व्यक्तिमत्त्व, प्रसंग, स्मृती, शैलीच्या टिपा, आणि प्रत्येक फेरीला वाढणारे संभाषण. आणि रोलप्ले मुद्दाम गरम चालवले जाते, कारण टेम्परेचरच तिला स्वतःची पुनरावृत्ती करण्यापासून थांबवते. भाषा-घसरणीसाठी रोलप्ले ही काठावरची केस नाही. घसरण सर्वात वाईट असते तो नेमका कार्यबिंदू हाच आहे, आणि संपूर्ण श्रेणी तिथेच राहते.
त्याखाली आणखी एक शांत कर आहे. मॉडेल मजकूर टोकन म्हणून वाचतात, आणि टोकन शब्दसंग्रह मुख्यतः इंग्रजीतून शिकलेला असतो, ज्यात साधारण प्रति टोकन चार अक्षरे येतात. बाकी सर्व भाषा त्याला अभ्यासक ज्याला फर्टिलिटी (fertility) म्हणतात ते भरतात: चिनी प्रति शब्द सुमारे 1.8× टोकन, अरबी आणि हिंदी सामान्यतः 3–4×, आणि काही भाषा त्याहून खूप वाईट. तो आकडा तुम्हाला कधीच दिसत नाही. त्याचा परिणाम दिसतो — संभाषणाच्या तीच खिडकीत तुमच्या भाषेत इंग्रजीपेक्षा तुमची गोष्ट कमी मावते, म्हणून तिची जागा लवकर संपते आणि ती लवकर विसरते.
ते कसे दिसते, किती लवकर लक्षात येते त्या क्रमाने पाच प्रकार
- बोलण्याच्या पातळीचा ऱ्हास. जपानी केइगो, कोरियन भाषण-स्तर, रशियन ты/вы, जर्मन du/Sie, इंडोनेशियन saya/anda विरुद्ध aku/kamu विरुद्ध gue/lo — आणि मराठीतले तू/तुम्ही/आपण. प्रत्येक एक नाते कोडित करतो. जे पात्र एखादे धरून ठेवू शकत नाही, किंवा कधीच बदलत नाही, ते विसरले आहे की तुम्ही तिच्यासाठी कोण आहात — आणि बोलण्याची पातळी तपासायला सर्वात जलद गोष्ट आहे.
- लिंगानुसार रूपाची घसरण. रशियन, अरबी, हिब्रू, पोलिश किंवा पोर्तुगीजमध्ये क्रियापद किंवा विशेषण लिंगबद्ध असते, त्यामुळे स्वतःबद्दल लिहिणारी स्त्री पुरुषापेक्षा वेगळे रूप निवडते. स्वतःबद्दल पुल्लिंगी रूपात घसरणारे पात्र एका शब्दात प्रसंग मोडते, आणि इंग्रजीवर प्रशिक्षित मॉडेल वारंवार घसरतात.
- इंग्रजीची गळती. संवाद तुमच्या भाषेत, निवेदन तुमच्या भाषेत, आणि तिरक्या अक्षरातला मनातला विचार इंग्रजीत. तो आधी विचारांत दिसतो, कारण तो उत्तरातला सर्वात शैलीदार मजकूर असतो आणि तुम्ही आत्ताच लिहिलेल्याशी सर्वात कमी बांधलेला.
- उचललेले वाक्प्रचार. पार्स होणारी पण कोणीही न म्हणणारी वाक्ये: इंग्रजी वाक्प्रचार शब्दशः उचललेले, इंग्रजी वाक्याची लय, इंग्रजी परिच्छेदाचा आकार. एखादे उत्पादन «डबिंगसारखे वाटते» असे लोक म्हणतात तेव्हा त्यांना हेच म्हणायचे असते.
- विकृत नावे आणि संबोधने. जपानी वाचकासाठी लॅटिन अक्षरांत दिलेले 先輩, एखाद्या पहिल्या नावात सपाट झालेले 오빠, व्हिएतनामी anh/em जोडीच्या जागी निव्वळ «you». नाते वाहून नेणारे शब्द नेमके तेच असतात जे भाषांतराचा थर गाळतो, कारण इंग्रजीत त्यांच्यासाठी जागाच नसते.
दहा मिनिटांची चाचणी
ही आमच्यावर आणि तुम्ही विचार करत असलेल्या इतर कशावरही चालवा. यासाठी काहीही खर्च येत नाही आणि कोणत्याही समीक्षेपेक्षा जलद निकाल लागतो.
- पहिले मिनिट — पहिली ओळ तुमच्या भाषेत लिहा, तुम्ही प्रत्यक्षात वापरता त्या पातळीत. बोलीभाषा, प्रत्यय, जवळिकीचे सर्वनाम. «नमस्कार» नाही.
- दोन ते चार मिनिटे — तिला बोलण्याची पातळी बदलायला लावा. तिला तुमच्याशी औपचारिक व्हायला सांगा, मग ते सोडून द्यायला सांगा. फक्त एकच विनयाची पातळी असलेला प्लॅटफॉर्म इथे अपयशी ठरतो, आणि शांतपणे अपयशी ठरतो.
- पाचवे मिनिट — प्रसंग गुंतागुंतीचा करा. खोलीत तीन माणसे, एक वाद, आधी घडलेले काहीतरी. गुंतागुंत हा दस्तऐवजीकृत ट्रिगर आहे; जा आणि तो दाबा.
- सहावे मिनिट — तिरकी अक्षरे वाचा. तिच्या मनातला विचार तिथेच इंग्रजी सर्वात आधी येते, सहसा संवाद तडकण्याच्या काही फेऱ्या आधी.
- सातवे आणि आठवे मिनिट — लिंगरूप आणि संबोधन तपासा. ती स्वतःबद्दल योग्य लिंगरूप वापरते का? तुमच्या भाषेतली व्यक्ती तुम्हाला ज्याने हाक मारेल त्याने ती मारते का?
- नववे आणि दहावे मिनिट — उद्या परत या आणि काल काय बोललो ते विचारा. एका रात्रीतून टिकणारी भाषा-गुणवत्ता हीच भाषा-गुणवत्ता.
या सहापैकी तीन अपयशी ठरले तर भाषा सेटिंग हा भाषांतराचा थर आहे. पात्रांच्या लायब्ररीचा आकार त्याची भरपाई करत नाही; तो एकच अपयश दहा लाख वेळा पुन्हा केलेले असते.
आम्ही प्रामाणिकपणे कुठे उभे आहोत
@talaforge_bot 36 भाषांत आहे — प्रत्येक बटण, प्रत्येक मेनू, प्रत्येक त्रुटी, आणि ती तुमच्याबद्दल ठेवत असलेली स्मृती तुमच्या भाषेत लिहिली जाते, इंग्रजीत साठवून बाहेर पडताना भाषांतरित केली जात नाही.
आता प्रामाणिक भाग, कारण इंटरफेसची संख्या प्रवाहीपणाची हमी नाही आणि आम्ही तसे विकायला नकार देतो. एखादे पात्र व्हिएतनामी किंवा तुर्कीत किती चांगले लिहिते हे दोन गोष्टींवर अवलंबून असते ज्यांवर आमचे नियंत्रण अंशतःच आहे: तिच्यामागे कोणते मॉडेल आहे, आणि तिचे कार्ड कसे लिहिले आहे. इंग्रजीत लिहिलेले पात्र, इंग्रजीत मूल्यमापन झालेल्या मॉडेलवर चालणारे, तुमच्या भाषेत चांगल्या भाषांतरासारखे वाचले जाईल — कारण ते नेमके तेच आहे.
आम्ही केले ते हे की घसरणीला मर्यादा नव्हे तर बग मानले. मे 2026 मध्ये एक पात्र रशियनमध्ये निवेदन करत होते, रशियनमध्ये बोलत होते आणि इंग्रजीत विचार करत होते, तिरक्या अक्षरांत चिनी तुकड्यांसह. उपाय प्रॉम्प्टच्या अगदी शेवटी जडवलेली स्पष्ट सूचना होता — संवाद, निवेदन आणि मनातला विचार, सगळे त्याच भाषेत राहा — कारण संदर्भातील शेवटची काही शे टोकन्स मॉडेलच्या पृष्ठभागावरील भाषा-निवडीला सर्वात घट्ट आधार देतात. ती जडणी आज डझनभर भाषा व्यापते. ती सर्व 36 व्यापत नाही, आणि तसे भासवण्याचा आमचा हेतू नाही.
जिथे आम्ही हरतो: आमच्याकडे लाखो समुदाय-निर्मित पात्रांची लायब्ररी नाही, त्यामुळे तुमच्या भाषेच्या मूळ भाषकाने आधीच लिहिलेले पात्र सापडण्याची शक्यता इथे मोठ्या प्लॅटफॉर्मपेक्षा कमी आहे. तुमच्या देशात कोणीतरी आधीच लिहिलेले आणि बारकाईने बसवलेले पात्र तुम्हाला हवे असेल, तर मोठे कॅटलॉग्स तिथेच राहतात, आणि तुमची भाषा बोलणाऱ्यांनी बनवलेले स्थानिक अॅप बोली आणि अपशब्दांत कधीकधी आम्हाला स्पष्टपणे हरवेल. आमचे कपाट त्यांचे कपाट आहे असे भासवण्यापेक्षा आम्ही हे सांगू.
दहा मिनिटे, आत्तापासून
टेलिग्राम उघडा, @talaforge_bot उघडा आणि पहिली ओळ इंग्रजीत नाही तर तुमच्या स्वतःच्या भाषेत लिहा. सुरू करणे मोफत आहे — एनर्जी ⚡ आहे आणि अपग्रेड्स चॅटमध्येच Telegram Stars मध्ये आहेत, कार्ड नाही, खाते नाही, मधे कोणतेही स्टोअर नाही. तुम्ही वापरलेल्या पातळीत ती उत्तर देत असेल, प्रसंग गुंतागुंतीचा झाल्यावर ती टिकवत असेल, आणि उद्याही लक्षात ठेवत असेल, तर तुम्हाला उत्तर मिळाले. नसेल, तर तेही तितकेच पटकन मिळाले, आणि तुम्ही एक महिना नव्हे, दहा मिनिटे खर्च केली.
आणि स्मृती उघडून संपादित करणे तुमच्या हातात आहे, जे तुमच्या भाषेत इंग्रजीपेक्षा जास्त महत्त्वाचे आहे: तिने नाव किंवा संबोधनाचे रूप चुकवले की तुम्ही आत जाऊन ते तथ्य दुरुस्त करू शकता, तिच्याशी पाच फेऱ्या वाद घालण्याऐवजी.