বেশির ভাগ মানুষ জিজ্ঞেস করে কোন মডেল সবচেয়ে ভালো আর একটা নাম শুনতে চায়। সৎ উত্তর হলো, প্রশ্নটাতে একটা শব্দ নেই: কীসে সবচেয়ে ভালো। যে মডেল দুর্দান্ত ধীরলয়ের গদ্য লেখে, সে চল্লিশটা উত্তর পরে গল্পের সুতো হারিয়ে ফেলবে; আর যে গল্প ধরে রাখে, সে লিখবে দক্ষ রিপোর্টের মতো।
একবারেই সিদ্ধান্ত নিয়ে ফেলতে হয় না। ক্যারেক্টার, তার ব্যক্তিত্ব আর সে যা কিছু মনে রাখে — এসবই শব্দ বানানো মডেলটা থেকে আলাদা, তাই মডেল বদলানো কোনো প্রতিশ্রুতি নয়, প্রতি দৃশ্যের একটা পছন্দ।
কোন ধরনটা কীসে ভালো
পাঁচটা পাওয়া যায়, আর এগুলো একই জিনিসের পাঁচটা মাপ নয়, সত্যিই আলাদা আলাদা বাদ্যযন্ত্র।
- Standard — প্রতিটা নতুন ক্যারেক্টার এতেই চলে। দ্রুত, স্থির, আর বেশির ভাগ দৃশ্যের জন্য যথেষ্ট ভালো। এটা তোমাকে কখনো বাছতে হয় না; এটা আগে থেকেই আছে।
- GLM — দৃশ্য জটিল হয়ে উঠলে এক ধাপ উপরে। যুক্তি আঁটসাঁট, আর লম্বা আদান-প্রদান জুড়ে একটা পরিকল্পনা ধরে রাখে।
- Claude Opus — সবচেয়ে ঘন গদ্য আর অন্তর্নিহিত অর্থ। ধীরলয়ের দৃশ্য, ধারালো সংযম, এমন ক্যারেক্টার যারা যা বলে তার চেয়ে বেশি ইঙ্গিত করে।
- Google Gemma — দ্রুত, উষ্ণ আর খেলুড়ে। হালকা রসিকতা আর ঝটপট কথা চালাচালির জন্য ভালো।
- DeepSeek — লম্বা, মোড়-ঘোরা গল্পকে সুতো না হারিয়ে একসঙ্গে ধরে রাখে।
কী করে বুঝবে তুমি ভুল মডেলে আছ
লক্ষণগুলো নির্দিষ্ট, আর একবার চিনে ফেললে আর আন্দাজ করতে হয় না।
উত্তরগুলো সুন্দর, কিন্তু গল্প চুপচাপ থেমে গেছে। তিন দৃশ্য আগে কেউ কিছু একটা কথা দিয়েছিল, তারপর থেকে সেটা আর কেউ মুখেও আনেনি। এটা যুক্তির সমস্যা — GLM বা DeepSeek-এর দিকে যাও।
সব কিছু সুসংগত, অথচ কিছুই মনে দাগ কাটছে না। ক্যারেক্টার ঠিক যা বোঝাতে চায় তা-ই বলে দেয়, ক্রম মেনে, কোনো অন্তর্নিহিত অর্থ ছাড়া। এটা গদ্যের সমস্যা, আর Claude Opus ঠিক এর জন্যই।
যেখানে হালকা থাকার কথা সেখানে দৃশ্যটা শক্ত আর আনুষ্ঠানিক হয়ে গেছে। বেশি ক্ষমতাধর মডেলের চেয়ে বরং উষ্ণ আর দ্রুত মডেল এখানে ভালো বসে; এখানেই Gemma নিজের জায়গা করে নেয়।
অনেক আগে যা প্রতিষ্ঠিত হয়েছিল ক্যারেক্টার তার উল্টো বলছে। মডেলকে দোষ দেওয়ার আগে মেমরি দেখে নাও — ফ্যাক্টটা যদি কখনো লেখাই না হয়ে থাকে, কোনো মডেলই সেটা ঠিকভাবে বানিয়ে নিতে পারবে না।
মডেল বদলালে কিছুই রিসেট হয় না
মডেল ক্যারেক্টারের অংশ নয়। পারসোনা, মেমরি, দৃশ্য আর ইতিহাস — সব ঠিক যেখানে ছিল সেখানেই থাকে; শুধু পরের উত্তরটা যে বানায় সেটাই বদলায়।
এতে মডেল বদলানো এত সস্তা হয়ে যায় যে সেটা সিদ্ধান্ত নয়, একটা হাতিয়ার হিসেবে ব্যবহার করা যায়। প্রচলিত একটা ধরন হলো দৃশ্যের কথা চালাচালির জন্য দ্রুত একটা মডেল, আর যে মুহূর্তটা আসল সেখানে ঘন একটাতে বদল — একটা স্বীকারোক্তি, একটা মুখোমুখি সংঘাত, একটা সমাপ্তি।
একটা জিনিস আশা করে রেখো: গলাটা সামান্য বদলে যাবে। একই পারসোনা দেওয়া দুটো মডেল হুবহু একরকম শোনাবে না, আর অনুচ্ছেদের মাঝখানে জোড়ার দাগ চোখে পড়তে পারে। একটা দৃশ্যের ভেতরে না বদলে দৃশ্যের ফাঁকে বদলালে সেটা প্রায় পুরোপুরি ঢাকা পড়ে যায়।
স্যাম্পলিং মানুষ যতটা ভাবে তার চেয়ে বেশি গুরুত্বপূর্ণ
মডেলের পছন্দ ছাদটা ঠিক করে দেয়; স্যাম্পলিং প্যারামিটার ঠিক করে ওই সীমার ঠিক কোথায় তুমি নামবে। উত্তর কতটা অনুমানযোগ্য হবে তা নিয়ন্ত্রণ করে temperature — কম মানে স্থির, বেশি মানে বেশি চমক। বাকিগুলো (top_p, top_k, min_p, repetition penalty) ঠিক করে দেয় মডেল আদৌ কোন শব্দগুলোকে প্রার্থী হিসেবে বিবেচনা করবে।
যে মডেলকে ফ্যাকাশে লাগে, সেটা প্রায়ই মডেলের সমস্যা নয়, temperature-এর সমস্যা। যে ক্যারেক্টার প্রতি চার উত্তরে তার প্রিয় বাক্যটা আউড়ে যায়, সেটা repetition penalty-র সমস্যা।
এগুলো প্রতি ক্যারেক্টার আর প্রতি প্যাকেজে সামনে আনা থাকে, আর JSON হিসেবে ইমপোর্ট-এক্সপোর্ট হয়, তাই যে মানগুলো কাজ করে সেগুলো প্রতিবার মাথা থেকে বানানোর বদলে সংরক্ষণ করে অন্য জায়গায় নেওয়া যায়।
এই তালিকাটা কী, আর কী নয়
পাঁচটা মডেল, বেছে নেওয়া হয়েছে কারণ এরা সত্যিই আলাদা জমি ঢাকে, সংখ্যাটা দেখতে বড় লাগানোর জন্য নয়। ভালো মডেল এলে তালিকা বদলায় — এটা রাউটিংয়ের সিদ্ধান্ত, নির্দিষ্ট কোনো নাম নিয়ে প্রতিশ্রুতি নয়।
এখানে কোনো র্যাঙ্কিং নেই, কারণ র্যাঙ্কিং পুরোপুরি নির্ভর করে তোমার সামনের দৃশ্যটার ওপর। যে পাতা বলে অমুক মডেলই রোলপ্লের জন্য সেরা, সে এমন কোনো দৃশ্যে হাত দেয়নি যেখানে অন্য একটা দরকার ছিল।