Локальная нейросеть для общения и ролевых игр: KoboldCpp, LM Studio и Ollama
Содержание
- Зачем локальная модель: приватность и отсутствие лимитов
- Что нужно: VRAM, RAM, формат GGUF
- KoboldCpp: запуск за 5 минут
- LM Studio и Ollama: в чём разница
- Какие модели подходят для ролевых игр
- Подключение к SillyTavern
- Правила: вымышленные взрослые персонажи, ответственность пользователя
- Когда проще облачный компаньон
- Итоги
- Частые вопросы
Облачные ИИ-чаты удобны, но у них есть три вечные проблемы: лимиты сообщений, фильтры, которые меняются без предупреждения, и переписка, которая хранится на чужом сервере. Локальная нейросеть для общения решает все три: языковая модель работает прямо на вашем компьютере, без интернета и без подписки. В этом гайде разбираем, что нужно для локальной LLM (видеопамять, оперативная память, формат GGUF), как запустить KoboldCpp за пять минут, чем отличаются LM Studio и Ollama, какие модели подходят для ролевых игр, как подключить локальную модель к SillyTavern и какие правила действуют, даже когда модель «без цензуры».
Коротко
- Локальная LLM — языковая модель на вашем компьютере: приватно, без лимитов, работает без интернета.
- Формат моделей — GGUF; размер 7–12 млрд параметров в сжатой версии обычно помещается в 8–12 ГБ видеопамяти.
- KoboldCpp — один исполняемый файл без установки, со встроенным интерфейсом для ролевых игр. Качайте только с официальной страницы на GitHub.
- LM Studio — удобная программа с поиском моделей; Ollama — лёгкий сервер для подключения к другим интерфейсам.
- «Без цензуры» не значит «без правил»: только вымышленные взрослые персонажи, никаких реальных людей и лиц младше 18 лет.
Зачем локальная модель: приватность и отсутствие лимитов
Когда вы переписываетесь с ИИ-персонажем в облачном сервисе, каждое сообщение уходит на сервер компании. Там оно обрабатывается моделью, проходит модерацию и хранится по правилам сервиса. Для большинства пользователей это нормально, но есть сценарии, когда локальная модель выигрывает.
Преимущества локальной LLM
- Приватность. Переписка не покидает ваш компьютер. Никто не читает ваши истории, не использует их для обучения и не сможет раскрыть их при утечке данных сервиса.
- Нет лимитов. Нет платы за сообщение, нет дневных ограничений, нет очередей в часы пик. Ограничение одно — скорость вашего железа.
- Работа без интернета. После скачивания модели интернет не нужен: локальная llm без интернета работает в самолёте, на даче и при любых проблемах со связью.
- Стабильность. Модель не поменяется завтра из-за нового обновления фильтров. Вы сами решаете, когда обновляться.
- Гибкость. Можно менять модели, настройки генерации, системные промты, подключать разные интерфейсы.
Недостатки
- Нужен достаточно мощный компьютер: видеокарта с 8 ГБ памяти и больше или много оперативной памяти.
- Локальные модели обычно слабее крупнейших облачных моделей в логике и памяти на длинных диалогах.
- Первая настройка требует определённого времени и терпения: выбрать модель, квантизацию, шаблон промта.
- Нет встроенных картинок, голоса и готовых персонажей — всё собирается отдельно.
Если вам нужен результат прямо сейчас, без установки, облачные NSFW-чаты мы сравнивали в обзоре секс-чат с нейросетью.
Готовый компаньон без установки: попробовать Promptchan Партнёрская ссылка · 18+
Что нужно: VRAM, RAM, формат GGUF
Формат GGUF и квантизация
Большинство локальных моделей для общения распространяются в формате GGUF — это формат llama.cpp и программ на его основе (KoboldCpp, LM Studio, Ollama). Одна и та же модель выкладывается в разных вариантах квантизации: Q8, Q6, Q5, Q4 и ниже. Квантизация — это сжатие весов: чем ниже число, тем меньше файл и требования к памяти, но тем сильнее падает качество.
Практический ориентир сообщества: Q4_K_M или Q5_K_M — хороший баланс размера и качества для большинства задач. Ниже Q4 качество речи и логики заметно проседает, особенно у небольших моделей.
Что означают буквы в названиях файлов, чем K-кванты отличаются от I-квантов и как посчитать размер модели под свою память, — в отдельном гайде GGUF и квантизация.
Сколько нужно памяти
Приблизительное правило: файл GGUF в квантизации Q4 занимает чуть больше половины гигабайта на миллиард параметров, плюс память на контекст (историю диалога). Таблица ниже — ориентировочные размеры, а не наши замеры: точные цифры зависят от модели, квантизации и длины контекста.
| Размер модели | Примерный размер файла Q4 | Комфортно на | Для чего |
|---|---|---|---|
| 7–8 млрд параметров | Около 4–5 ГБ | Видеокарта 8 ГБ | Простые ролевые игры, быстрые ответы |
| 12–14 млрд | Около 7–9 ГБ | Видеокарта 12 ГБ | Хороший баланс для ролевых игр |
| 20–24 млрд | Около 12–15 ГБ | Видеокарта 16 ГБ | Более связные длинные истории |
| 30–35 млрд | Около 18–21 ГБ | Видеокарта 24 ГБ | Высокое качество речи и логики |
| 70 млрд и больше | 40 ГБ и больше | Несколько карт или много RAM | Для энтузиастов |
Если модель не помещается в видеопамять
KoboldCpp, LM Studio и Ollama умеют разделять модель между видеокартой и оперативной памятью: часть слоёв на GPU, часть на процессоре. Это работает, но скорость падает тем сильнее, чем больше слоёв на процессоре. Модель целиком на процессоре тоже запустится, если хватает RAM, но ответы будут медленными. Для комфортного общения стремитесь уместить модель в видеопамять целиком: тогда ответы идут почти в темпе живой переписки. Подробнее о выборе видеокарты — в гайде видеокарта для нейросетей: требования к VRAM для языковых моделей и генерации картинок похожи.
Mac на Apple Silicon
На Mac с чипами Apple Silicon видеокарта и процессор используют общую память, поэтому Mac с 16–32 ГБ и больше может запускать довольно крупные модели. LM Studio на Mac дополнительно поддерживает формат MLX, оптимизированный для этих чипов.
KoboldCpp: запуск за 5 минут
Если коротко о том, что такое KoboldCpp: это программа для запуска языковых моделей GGUF, построенная на llama.cpp, со встроенным интерфейсом KoboldAI Lite для чата и ролевых игр. По данным README проекта, это один исполняемый файл без установки и внешних зависимостей, который работает на процессоре или видеокарте и поддерживает частичную выгрузку модели на GPU.
Только официальная страница
Разработчик KoboldCpp предупреждает о фишинговом сайте, который выдаёт себя за официальный. Скачивайте программу только со страницы релизов проекта на GitHub (репозиторий LostRuins/koboldcpp).
Пошагово на Windows
- Скачайте файл koboldcpp.exe со страницы последнего релиза на GitHub.
- Скачайте модель в формате GGUF (например, модель на 12 млрд параметров в квантизации Q4_K_M) с Hugging Face.
- Запустите koboldcpp.exe. Откроется окно настроек.
- Выберите файл модели, пресет для вашей видеокарты и количество слоёв на GPU (GPU Layers). Для начала можно оставить автоматический подбор.
- Задайте размер контекста: 8192 токенов — разумный старт для ролевых игр.
- Нажмите Launch. Интерфейс откроется в браузере по адресу localhost:5001.
На Linux и Mac на Apple Silicon процесс похож: скачайте бинарник для своей системы, сделайте его исполняемым и запустите. Если своей видеокарты нет, у проекта есть официальный Colab-ноутбук, но учитывайте правила Colab.
Koboldcpp: как пользоваться интерфейсом
Встроенный интерфейс KoboldAI Lite поддерживает несколько режимов: чат, приключение, инструкции и режим писателя. Для ролевых игр полезны:
- Memory — постоянный текст, который модель видит всегда: описание персонажа и мира.
- World Info — записи, которые подключаются по ключевым словам: места, второстепенные персонажи, детали сюжета.
- Author’s Note — подсказка о стиле и тоне, которая вставляется близко к концу контекста.
- Карточки персонажей — KoboldCpp умеет загружать карточки в формате Tavern.
Кроме того, KoboldCpp предоставляет API, совместимые с популярными интерфейсами, поэтому его легко подключить к SillyTavern.
LM Studio и Ollama: в чём разница
Если KoboldCpp ориентирован на ролевые игры и истории, то LM Studio и Ollama — универсальные инструменты для запуска локальных моделей. Вопрос «lm studio или ollama» часто сводится к тому, нужен ли вам графический интерфейс.
LM Studio: что это
LM Studio — настольная программа с графическим интерфейсом для Windows, macOS и Linux. В ней есть встроенный поиск моделей на Hugging Face с подсказками, какая квантизация поместится в вашу память, удобный чат и локальный сервер с API, совместимым с OpenAI. Это самый простой вход для тех, кто не хочет разбираться с файлами и командной строкой. Модели скачиваются прямо из программы, а загруженные можно переключать в пару кликов и сравнивать ответы разных моделей на одном и том же запросе.
Ollama: что это
Ollama — лёгкий инструмент для запуска моделей, который работает как фоновый сервис. Модели скачиваются из собственной библиотеки одной командой, а другие программы подключаются к Ollama через локальный API. Есть и простое настольное приложение для чата. Ollama удобна, если вы собираетесь использовать модель из разных программ, в том числе из SillyTavern.
| Критерий | KoboldCpp | LM Studio | Ollama |
|---|---|---|---|
| Установка | Один файл, без установки | Обычный установщик | Установщик, работает в фоне |
| Интерфейс | Встроенный KoboldAI Lite для историй и ролевых игр | Удобный чат и поиск моделей | Простое приложение и командная строка |
| Поиск моделей | Вручную на Hugging Face | Встроенный поиск | Своя библиотека, команда загрузки |
| Ролевые функции | Memory, World Info, карточки персонажей | Системный промт | Системный промт |
| Подключение к SillyTavern | Да | Да, через совместимый API | Да |
| Для кого | Ролевые игры и истории | Новички, универсальный чат | Связка с другими программами |
LM Studio как пользоваться: короткая инструкция
- Установите LM Studio и откройте вкладку поиска моделей.
- Найдите модель и выберите вариант квантизации — программа подсказывает, какие файлы поместятся в вашу память.
- Скачайте файл, откройте вкладку чата и загрузите модель в верхней панели.
- Задайте системный промт с описанием персонажа и начните диалог.
- Чтобы подключить SillyTavern, включите в разделе для разработчиков локальный сервер — он работает с API, совместимым с OpenAI.
Это и есть вся LM Studio инструкция для старта: дальше остаётся подбирать модель и настройки генерации под свои истории.
Ollama что это и как пользоваться
Если коротко отвечать на запрос «ollama как пользоваться»: после установки Ollama работает в фоне, а модели запускаются одной командой в терминале, например ollama run и имя модели из библиотеки. При первом запуске модель скачивается, затем открывается чат прямо в консоли. Команда ollama list показывает скачанные модели, а ollama pull загружает модель без запуска. В настольной версии для Windows и macOS есть и простое окно чата. Как пользоваться Ollama вместе с другими программами: они подключаются к её локальному API, и именно так Ollama связывают с SillyTavern — об этом ниже.
Какие модели подходят для ролевых игр
Мы сознательно не публикуем «топ моделей без цензуры»: такие списки устаревают за месяц, а качество сильно зависит от задачи и языка. Вместо этого — критерии, по которым стоит выбирать.
Конкретные семейства моделей для ролевых игр на 2026 год, их сильные стороны и требования к памяти мы разбираем в статье лучшие модели для ролевых игр — её регулярно обновляем.
На что смотреть
- Базовая модель. Большинство моделей для ролевых игр — дообученные версии открытых семейств от крупных разработчиков. От базы зависят язык, логика и лицензия.
- Назначение дообучения. Модели, дообученные для историй и ролевых игр, пишут живее и лучше держат персонажа, чем универсальные ассистенты.
- Русский язык. Многие модели хорошо понимают русский, но отвечают на нём хуже, чем на английском. Проверяйте на своих диалогах; некоторые семейства заметно сильнее в русском. Если модель отвечает по-русски неуклюже, попробуйте написать системный промт и описание персонажа на английском, а в инструкции попросить отвечать по-русски.
- Шаблон промта. У каждой модели свой формат инструкций (chat template). Неправильный шаблон — частая причина «странных» ответов. В карточке модели обычно указано, какой шаблон использовать.
- Отзывы сообщества. Смотрите обсуждения и рейтинги моделей для ролевых игр — они обновляются быстрее любых статей.
- Лицензия. Для личного использования ограничений обычно нет, но у ряда моделей есть условия использования, которые стоит прочитать.
Что значит «uncensored»
Модели с пометкой uncensored или abliterated — это версии, в которых ослаблены встроенные отказы: модель не отказывается от сцен для взрослых и мрачных сюжетов в художественных историях. Но это не отменяет закон и ответственность пользователя. Про ролевые игры со взрослыми сценами и их границы — в гайде ролевые игры с ИИ 18+.
Подключение к SillyTavern
SillyTavern — самый популярный интерфейс для ролевых игр с ИИ: карточки персонажей, групповые чаты, лорбуки, гибкие настройки. Сам по себе он модель не запускает, а подключается к бэкенду — облачному API или локальному серверу. Подробный гайд по установке — в статье SillyTavern.
Как подключить KoboldCpp
- Запустите KoboldCpp с моделью и убедитесь, что он работает на localhost:5001.
- В SillyTavern откройте панель подключения к API.
- Выберите тип Text Completion и бэкенд KoboldCpp.
- Укажите адрес http://localhost:5001 и нажмите Connect.
- Выберите правильный шаблон промта (Instruct template) под вашу модель в настройках форматирования.
Как подключить Ollama или LM Studio
Ollama выбирается в SillyTavern как отдельный бэкенд Text Completion с её локальным адресом. LM Studio подключается через совместимый с OpenAI API: запустите локальный сервер в LM Studio и укажите его адрес в SillyTavern. В обоих случаях важно, чтобы модель уже была загружена на стороне сервера.
Настройки генерации для ролевых игр
| Параметр | Ориентир | Что делает |
|---|---|---|
| Temperature | 0,7–1,0 | Творческость; выше — разнообразнее, но менее связно |
| Min P | 0,05–0,1 | Отсекает маловероятные слова, держит связность |
| Repetition penalty | 1,05–1,15 | Борется с повторами |
| Длина ответа | 200–400 токенов | Длина реплики персонажа |
| Контекст | 8–16 тыс. токенов | Сколько истории модель помнит |
Это стартовые значения из практики сообщества, а не результат нашего теста. Подбирайте под модель: разные семейства по-разному реагируют на одни и те же параметры.
Правила: вымышленные взрослые персонажи, ответственность пользователя
Локально — не значит без правил
Локальная модель не проходит модерацию сервиса, поэтому вся ответственность за содержание лежит на вас. Правила те же, что и везде: только вымышленные взрослые персонажи (25+). Никаких реальных людей — знакомых, знаменитостей, блогеров. Никаких лиц младше 18 лет ни в каком виде, даже в вымышленных историях. Никакого насилия без согласия в сценариях. Эти ограничения действуют независимо от того, где работает модель, и нарушение закона остаётся нарушением.
Несколько практических советов по безопасности:
- Скачивайте программы только с официальных страниц, модели — с Hugging Face от известных авторов.
- Не открывайте локальный сервер в интернет без пароля: по умолчанию он доступен только с вашего компьютера, и так и должно остаться.
- Храните переписку и карточки персонажей в зашифрованной папке, если компьютером пользуются другие люди.
- Не загружайте в модель личные данные реальных людей.
Больше об этом — в статье безопасность нейросетей 18+.
Когда проще облачный компаньон
Локальная LLM — отличный выбор для энтузиастов: приватность, отсутствие лимитов и полный контроль. Но если у вас нет видеокарты на 8–12 ГБ, не хочется разбираться с квантизацией и шаблонами или нужны картинки, голос и готовые персонажи в одном месте, облачный сервис проще. В Promptchan есть чат с готовыми и собственными персонажами, режимы чата и истории, голосовые сообщения и генерация изображений из сцены — всё в браузере, с бесплатным стартом.
Promptchan
Лучший для ИИ-компаньонов
ИИ-персонажи, чат-компаньоны и изображения персонажей
- Чат с ИИ-компаньонами и создание своего персонажа
- Генерация изображений персонажа по тексту
- Аниме и фотореалистичные стили, библиотека поз
- Веб, iOS и Android
- Лучше всего для
- ИИ-девушка, чат и истории с персонажем
- Бесплатно
- Бесплатно: ежедневные гемы на картинки и чат
- Цена
- Plus $14.99 · Premium $23.99 · Pro $33.99 в месяц (проверено 30.09.2026)
Партнёрская ссылка · 18+ · только генерация с нуля
Компаньон без установки: открыть Promptchan Партнёрская ссылка · 18+
Итоги
Для локальной нейросети для общения нужна модель в формате GGUF и программа для её запуска. Проще всего начать с KoboldCpp (один файл, встроенный интерфейс для ролевых игр) или LM Studio (удобный поиск моделей). Ollama удобна как сервер для SillyTavern и других программ. Выбирайте модель на 7–14 млрд параметров под видеокарту на 8–12 ГБ, используйте квантизацию Q4_K_M или Q5_K_M и правильный шаблон промта. И помните: локальная модель «без цензуры» не отменяет правил — только вымышленные взрослые персонажи.
Частые вопросы
Что такое локальная LLM?
Это языковая модель, которая работает на вашем компьютере, а не на сервере компании. Переписка не покидает устройство, нет лимитов сообщений, а после загрузки модели интернет не нужен.
KoboldCpp — что это?
Это программа для запуска языковых моделей в формате GGUF на основе llama.cpp. Она распространяется одним файлом без установки и включает интерфейс KoboldAI Lite для чата и ролевых игр.
Что выбрать: LM Studio или Ollama?
LM Studio удобнее новичкам: графический интерфейс и встроенный поиск моделей. Ollama лучше подходит как фоновый сервер для подключения к SillyTavern и другим программам.
Сколько видеопамяти нужно для локальной нейросети?
Модель на 7–8 млрд параметров в квантизации Q4 обычно помещается в 8 ГБ видеопамяти, на 12–14 млрд — в 12 ГБ. Модель можно частично выгрузить в оперативную память, но скорость упадёт.
Можно ли использовать локальную нейросеть без цензуры?
Существуют модели с ослабленными отказами для художественных историй. Но ответственность за содержание лежит на пользователе: только вымышленные взрослые персонажи, никаких реальных людей и лиц младше 18 лет.
Как подключить KoboldCpp к SillyTavern?
Запустите KoboldCpp с моделью, в SillyTavern выберите тип Text Completion и бэкенд KoboldCpp, укажите адрес localhost:5001 и нажмите Connect.
Работает ли локальная LLM без интернета?
Да. Интернет нужен только для скачивания программы и модели, дальше всё работает офлайн.



