Большинство спрашивают, какая модель лучше, и ждут имени. Честный ответ — в вопросе не хватает слов: лучше в чём. Модель, которая пишет роскошную медленную прозу, потеряет нить сюжета на сороковом ответе, а та, что держит сюжет, будет писать как добротный отчёт.
Решать раз и навсегда не нужно. Персонаж, его характер и всё, что он помнит, отделены от модели, которая порождает слова, так что переключение — это выбор на сцену, а не обязательство.
В чём хорош каждый тип
Доступны пять, и это действительно разные инструменты, а не пять размеров одного и того же.
- Standard — то, на чём работает каждый новый персонаж. Быстрая, ровная и достаточно хорошая для большинства сцен. Её не нужно выбирать — она уже там.
- GLM — ступень вверх, когда сцена усложняется. Более строгая логика, держит план на протяжении долгого обмена.
- Claude Opus — самая богатая проза и подтекст. Медленные сцены, точная сдержанность, персонажи, которые подразумевают больше, чем говорят.
- Google Gemma — быстрая, тёплая и игривая. Хороша для лёгкой пикировки и непринуждённого обмена репликами.
- DeepSeek — держит длинные, запутанные истории вместе, не теряя нити.
Как понять, что ты не на той модели
Симптомы конкретные, и, узнав их, ты перестаёшь гадать.
Ответы красивые, а сюжет незаметно встал. Кто-то что-то обещал три сцены назад, и с тех пор никто об этом не вспомнил. Это проблема рассуждения — двигайся к GLM или DeepSeek.
Всё связно — и ничто не задевает. Персонаж говорит ровно то, что имеет в виду, по порядку, без подтекста. Это проблема прозы, и для неё существует Claude Opus.
Сцена стала жёсткой и формальной там, где должна быть лёгкой. Более тёплая и быстрая модель подойдёт лучше более способной; вот где Gemma отрабатывает своё место.
Персонаж противоречит чему-то давно установленному. Прежде чем винить модель, проверь память — если факт не был записан, ни одна модель не изобретёт его правильно.
Переключение ничего не сбрасывает
Модель — не часть персонажа. Личность, память, сцена и история остаются ровно там, где были; меняется только то, что порождает следующий ответ.
Поэтому переключение достаточно дёшево, чтобы быть инструментом, а не решением. Частый приём — быстрая модель для обмена репликами в сцене и переход на более богатую в момент, который важен: признание, столкновение, финал.
К одному стоит быть готовым: голос немного сдвинется. Две модели с одной и той же личностью не будут звучать одинаково, и посреди абзаца шов может быть заметен. Переключение между сценами, а не внутри одной, скрывает его почти полностью.
Сэмплинг важнее, чем принято думать
Выбор модели задаёт потолок; параметры сэмплинга решают, где в этом диапазоне ты окажешься. Температура управляет предсказуемостью ответа — ниже ровнее, выше неожиданнее. Остальные (top_p, top_k, min_p, штраф за повторы) ограничивают, какие слова-кандидаты модель вообще рассматривает.
Модель, которая кажется плоской, — часто проблема температуры, а не модели. Персонаж, повторяющий любимую фразу каждый четвёртый ответ, — проблема штрафа за повторы.
Они открыты на каждого персонажа и каждый пакет, экспортируются и импортируются как JSON — так что рабочий набор значений можно сохранить и перенести, а не собирать каждый раз по памяти.
Что этот набор собой представляет, а что нет
Пять моделей, выбранных потому, что они покрывают действительно разную территорию, а не чтобы число выглядело внушительно. Набор меняется по мере появления лучших моделей — это решение о маршрутизации, а не обещание конкретных имён.
Рейтинга здесь нет, потому что рейтинг целиком зависит от сцены перед тобой. Страница, которая говорит, что одна модель просто лучше всех для ролевых игр, не пробовала сцену, которой была нужна другая.