רוב האנשים שואלים איזה מודל הכי טוב ומצפים לשם. התשובה הכנה היא שלשאלה חסרה מילה: הכי טוב במה. מודל שכותב פרוזה יפה שנבנית לאט יאבד את חוט העלילה אחרי ארבעים תגובות, והמודל שמחזיק את העלילה יכתוב כמו דוח מוצלח.
אתם לא חייבים להחליט פעם אחת. הדמות, האופי שלה וכל מה שהיא זוכרת נפרדים מהמודל שמייצר את המילים, ולכן החלפה היא בחירה לכל סצנה ולא התחייבות.
במה כל סוג טוב
חמישה מודלים זמינים, והם באמת כלים שונים ולא חמישה גדלים של אותו דבר.
- Standard — מה שכל דמות חדשה רצה עליו. מהיר, יציב ומספיק טוב לרוב הסצנות. אתם לא צריכים לבחור בו; הוא כבר שם.
- GLM — מדרגה למעלה כשסצנה נעשית מסובכת. היגיון הדוק יותר, והחזקה של תוכנית לאורך חילופי דברים ארוכים.
- Claude Opus — הפרוזה העשירה ביותר ורובד המשמעות הנסתר. סצנות שנבנות לאט, איפוק חד, ודמויות שרומזות יותר ממה שהן אומרות.
- Google Gemma — מהיר, חמים ושובב. מתאים להתגרות קלילה ולהתכתבות מהירה.
- DeepSeek — מחזיק יחד סיפורים ארוכים ומתפתלים בלי לאבד את החוט.
איך יודעים שאתם על המודל הלא נכון
התסמינים מאוד ספציפיים, וברגע שמכירים אותם מפסיקים לנחש.
התגובות יפות אבל העלילה נעצרה בשקט. מישהו הבטיח משהו לפני שלוש סצנות ואף אחד לא הזכיר את זה מאז. זו בעיית חשיבה, ולכן כדאי לזוז לכיוון GLM או DeepSeek.
הכול קוהרנטי ושום דבר לא נוחת. הדמות אומרת בדיוק את מה שהיא מתכוונת, לפי הסדר, בלי שום רובד נסתר. זו בעיית כתיבה, ובדיוק בשביל זה יש את Claude Opus.
הסצנה נעשתה נוקשה ורשמית במקום שבו היא אמורה להיות קלילה. כאן מודל חמים ומהיר מתאים יותר ממודל חזק יותר, וכאן Gemma מצדיק את מקומו.
הדמות סותרת משהו שנקבע מזמן. בדקו את הזיכרון לפני שאתם מאשימים את המודל: אם העובדה מעולם לא נכתבה, שום מודל לא ימציא אותה נכון.
החלפה לא מאפסת כלום
המודל אינו חלק מהדמות. האופי, הזיכרון, הסצנה וההיסטוריה נשארים בדיוק איפה שהיו; משתנה רק הדבר שמייצר את התגובה הבאה.
זה הופך את ההחלפה לזולה מספיק כדי להיות כלי ולא החלטה. דפוס נפוץ הוא מודל מהיר לחילופי הדברים של הסצנה ומעבר למודל עשיר יותר לרגע שחשוב: וידוי, עימות, סיום.
דבר אחד כן לצפות לו: הקול יזוז קצת. שני מודלים שקיבלו את אותו אופי לא יישמעו זהים, ובאמצע פסקה התפר עלול להיראות. החלפה בין סצנות במקום בתוך סצנה מסתירה אותו כמעט לגמרי.
דגימה חשובה יותר ממה שחושבים
בחירת המודל קובעת את התקרה; פרמטרי הדגימה קובעים איפה בתוך הטווח הזה תנחתו. טמפרטורה שולטת בכמה תגובה צפויה: נמוך יותר יציב יותר, גבוה יותר מפתיע יותר. השאר (top_p, top_k, min_p, קנס חזרתיות) מגבילים אילו מילים מועמדות המודל בכלל שוקל.
מודל שמרגיש שטוח הוא לרוב בעיית טמפרטורה ולא בעיית מודל. דמות שחוזרת על משפט אהוב כל תגובה רביעית היא בעיית קנס חזרתיות.
הפרמטרים חשופים לכל דמות ולכל חבילה, והם מיוצאים ומיובאים כ-JSON, כך שסט ערכים שעובד אפשר לשמור ולהעביר במקום לבנות מחדש מהזיכרון בכל פעם.
מה הרשימה כן ומה היא לא
חמישה מודלים, שנבחרו כי הם מכסים שטח שונה באמת ולא כדי שהמספר ייראה מרשים. הרשימה משתנה ככל שמופיעים מודלים טובים יותר: זו החלטת ניתוב ולא הבטחה לשמות מסוימים.
אין כאן דירוג כי הדירוג תלוי לגמרי בסצנה שלפניכם. דף שאומר לכם שמודל אחד הוא פשוט הכי טוב למשחקי תפקידים לא ניסה סצנה שדרשה אחר.