Сборка модов на Скайрим с нейросетью: полное руководство по установке ИИ-диалогов

Подробное руководство по установке нейросетевых модов для Skyrim: Mantella, xVASynth, KoboldCpp. Настройка ИИ-диалогов, голосового ввода, синтеза речи и локальных LLM.

Что такое нейросетевые моды для Skyrim и зачем они нужны

Традиционный моддинг The Elder Scrolls V: Skyrim десятилетиями ограничивался изменением текстур, моделей, добавлением квестов и реплик. Однако с развитием больших языковых моделей (LLM) появился принципиально новый класс модификаций, которые меняют саму механику взаимодействия с игровым миром. Речь идет о нейросетевых модах, которые позволяют NPC генерировать уникальные диалоги на лету, а не использовать заранее записанные фразы.

Суть технологии заключается в интеграции трех ключевых компонентов: языковой модели (LLM), которая выступает «мозгом» персонажа, системы синтеза речи (TTS) для озвучки и системы распознавания речи (STT) для голосового ввода от игрока. Вместе они создают иллюзию живого собеседника, который помнит ваши прошлые действия, реагирует на текущую ситуацию и может поддержать разговор на любую тему.

Наиболее популярным и стабильным решением на сегодняшний день является мод Mantella, который выступает связующим звеном между игрой и внешними ИИ-сервисами. Также существует дополнение Herika — ИИ-компаньон, который может сопровождать игрока. Эти моды не просто добавляют новые строки диалогов, а создают динамическую систему, где каждый ответ генерируется в реальном времени с учетом контекста: локации, времени суток, экипировки игрока и его репутации.

Как работает связка Mantella, LLM, TTS и STT

Чтобы понять, как собрать рабочую конфигурацию, важно разобраться в архитектуре взаимодействия компонентов. Мод Mantella работает как «мост» между игровым движком и внешними сервисами искусственного интеллекта. Когда игрок начинает диалог с NPC, Mantella собирает контекстную информацию: кто говорит, где находится персонаж, какая сейчас погода, что надето на игроке, какие квесты активны.

Эта информация передается в языковую модель (LLM), которая генерирует текстовый ответ от лица NPC. В качестве LLM можно использовать как облачные сервисы (ChatGPT, Claude), так и локальные модели, запускаемые через KoboldCpp. Локальный вариант предпочтителен для тех, кто хочет избежать ежемесячной платы и не зависеть от интернет-соединения.

Далее сгенерированный текст поступает в систему синтеза речи (TTS). Здесь используется программа xVASynth, которая может имитировать голоса оригинальных актеров озвучки Skyrim. Это достигается за счет специальных голосовых моделей, обученных на записях из игры. Например, модель Female Serana позволяет Серане говорить новыми фразами ее собственным голосом.

Наконец, система распознавания речи (STT) преобразует голос игрока в текст. Это может быть встроенная функция Whisper от OpenAI или аналогичные решения. Игрок может просто говорить в микрофон, и его слова будут переданы NPC. Альтернативно можно вводить текст с клавиатуры, что проще для первого запуска.

Подготовка: выбор версии Skyrim и установка SKSE

Первый и критически важный шаг — выбор версии игры. Оба источника сходятся во мнении, что для нейросетевых модов лучше использовать GOG-версию Skyrim Special Edition, а не Steam-версию. Причина в том, что GOG-версия не имеет защиты DRM и менее подвержена конфликтам с модами, особенно с теми, которые требуют глубокой интеграции в игровой процесс.

После установки игры необходимо скачать Skyrim Script Extender (SKSE) — расширение скриптов, которое открывает доступ к дополнительным функциям движка. Важно выбрать версию, соответствующую вашей версии игры. Например, для игры версии 1.6.1179 подойдет SKSE 2.2.6. Распакуйте архив в корневую папку игры так, чтобы файл skse64_loader.exe находился рядом с SkyrimSE.exe.

Рекомендуется создать отдельную папку для всех компонентов ИИ-сборки, например, E:\OpenAI или C:\xVASynth. Это упростит навигацию и настройку путей в конфигурационных файлах. Также стоит заранее продумать структуру папок: отдельно для xVASynth, отдельно для KoboldCpp и отдельно для модов Mod Organizer 2.

Установка xVASynth: синтез речи и голосовые модели

xVASynth — это программа для синтеза речи, которая использует нейросетевые модели для генерации голоса. Для работы с Skyrim необходимо скачать основную версию xVASynth v3.0.0 и патч v3.0.2, который исправляет ошибки и добавляет функции. Патч распаковывается поверх основной программы.

Для качественной русской озвучки рекомендуется установить Russian Dictionary — словарь транскрипции английских слов. Он распаковывается в папку resources\app\python\xvapitch\text\dicts с заменой существующего файла. Это улучшит произношение русских слов при синтезе английской речи.

Далее потребуется установить вспомогательные плагины: .lip and .fuz plugin for xVASynth, который позволяет создавать файлы анимации губ, и FaceFXWrapper 0.4, который отвечает за синхронизацию движений губ с речью. Файл FaceFXWrapper.exe необходимо перенести в папку resources\app\plugins\lip_fuz.

Голосовые модели — ключевой элемент. Для первого запуска достаточно скачать две модели: Female Serana и Male Nord. Их необходимо распаковать в папку resources\app\models\Skyrim и переименовать файлы .json и .pt в sk_serana. и sk_malenord. соответственно. Также рекомендуется создать копию модели Сераны и переименовать ее в sk_femalenord.* — это позволит использовать женский голос для всех женских NPC, если подходящей модели не найдется.

Настройка xVASynth: плагины, словари и параметры

После установки всех компонентов необходимо правильно настроить xVASynth. Запустите xVASynth.exe и в правом верхнем углу нажмите на иконку паззла, чтобы открыть меню плагинов. Активируйте плагин .lip and .fuz file maker и нажмите Apply, соглашаясь с настройками по умолчанию.

Затем нажмите кнопку AE (также в правом верхнем углу) и в открывшемся окне подключите все слова в словарях CMUDicT и XVADict — Elder Scrolls. Это необходимо для корректного произношения имен и терминов из игры.

В левом верхнем углу нажмите кнопку со стрелочками и выберите игру Skyrim из списка. После этого в основном окне появятся загруженные голосовые модели. Далее откройте настройки (иконка шестеренки) и проверьте следующие параметры: пути к папкам моделей и вывода, выбор динамиков и микрофона. В разделе формата вывода выберите «Game (The .lip format)» — Skyrim/Fallout 3/Fallout NV. Установите галочки напротив опций «Delete lip files», «Make fuz files» и «Skip existing».

Установка KoboldCpp и локальной языковой модели

KoboldCpp — это программа, которая позволяет запускать большие языковые модели локально на вашем компьютере. Это бесплатная альтернатива облачным сервисам, которая не требует подключения к интернету и не взимает плату за использование. Скачайте файл koboldcpp.exe (примерно 500 МБ) и сохраните его в отдельную папку, например, E:\OpenAI\Kobold.

Далее необходимо скачать саму языковую модель в формате GGUF. Для Skyrim рекомендуется модель Mistral-Nemo-Instruct-2407-Q4_K_M.gguf — это доработанная версия Mistral-Nemo, обученная совместно Mistral AI и NVIDIA. Она обеспечивает хороший баланс между качеством ответов и требованиями к оборудованию.

Запустите koboldcpp.exe. В открывшемся окне снимите галочку с пункта Launch Browser, нажмите кнопку GGUF Text Model: Browse и выберите скачанный файл модели. Рекомендуется увеличить размер контекста до 8192 токенов — это позволит NPC помнить более длинные разговоры. Если вы хотите добавить NPC возможность «видеть» окружающий мир, можно дополнительно скачать модель графического распознавания и подключить ее на вкладке «Loaded Files».

Сохраните настройки в файл settings.kcpps в той же папке, где находится koboldcpp.exe. Можно создать два конфига: один с зрением, другой без — и переключаться между ними при запуске.

Установка модов через Mod Organizer 2

Mod Organizer 2 (MO2) — это менеджер модов, который позволяет устанавливать и управлять модификациями, не изменяя оригинальные файлы игры. Скачайте и установите MO2 в отдельную папку, например, E:\SkyrimAI\MO2. При первом запуске выберите режим Portable и укажите версию игры GOG.

Для работы нейросетевой сборки потребуется установить следующий набор модов в указанном порядке:

  • Unofficial SSE Patch и его русская версия — исправляют ошибки игры;
  • Address Library for SKSE Plugins (вариант All in one 1.6.X) — библиотека адресов для SKSE-плагинов;
  • PapyrusUtil SE (версия для SKSE 2.2.6 и Skyrim 1.6.1179 GOG) — утилита для скриптов;
  • SkyUI Russian translation — русский интерфейс;
  • UIExtensions — расширение пользовательского интерфейса;
  • World Encounter Hostility Fix (Performance Version) — исправление враждебности NPC;
  • No NPC Greetings — отключает стандартные приветствия, которые мешают ИИ-диалогам;
  • Mantella — основной мод для ИИ-диалогов;
  • FonixData File (вариант Mod Manager Install) — данные для синтеза речи;
  • SSE Russian Fix Console (по желанию) — исправление русской консоли.

Устанавливайте моды в том же порядке, в котором они указаны. После установки Mantella необходимо отредактировать файл GPT_SECRET_KEY.txt, который находится в папке мода. Впишите туда строку http://localhost:5001/api/ — это адрес локального сервера KoboldCpp.

Настройка конфигурационных файлов Mantella

После установки всех модов необходимо настроить конфигурацию Mantella. Откройте файл config.ini в папке E:\SkyrimAI\Mantella (или в папке, куда вы установили Mantella Software). Внесите следующие изменения:

  • game = Skyrim — указывает, для какой игры настроен мод;
  • skyrim_folder = путь до папки с установленной игрой;
  • skyrim_mod_folder = путь до папки с модом Mantella в Mod Organizer 2 (например, E:\SkyrimAI\MO2\mods\Mantella);
  • xvasynth_folder = путь до папки с xVASynth;
  • language = ru — выбор языка синтеза речи;
  • microphone_enabled = 1 — использовать голосовой ввод (1) или текстовый (0).

Также в файле custom_user_folder.ini, который находится в папке SKSE\Plugins\MantellaSoftware, укажите параметр custom_user_folder = E:/SkyrimAI/Mantella/. Это позволит хранить все пользовательские данные в одном месте, а не в «Моих документах».

Важный нюанс: GOG-версия игры может все равно обращаться к файлам в «Моих документах». Поэтому после первого запуска проверьте папку %USERPROFILE%\Documents\My Games\Skyrim Special Edition GOG. Если файл Skyrim.INI не был создан, скопируйте его из папки E:\SkyrimAI\Skyrim\Skyrim_Default_ru.ini и переименуйте. В файле SkyrimPrefs.ini убедитесь, что параметры iSize W=1280, iSize H=1024, bFull Screen=0, bBorderless=1, bDialogueSubtitles=1, bGeneralSubtitles=1 установлены корректно.

Запуск сборки и устранение типичных проблем

Порядок запуска всех компонентов критически важен. Сначала запустите xVASynth, затем KoboldCpp (первый запуск может занять много времени, так как модель загружается в память), затем Mod Organizer 2 и, наконец, запустите игру через MO2, выбрав профиль SKSE.

При первом запуске Mantella автоматически откроет окно консоли и, возможно, браузер. Это нормально — программа создает необходимые конфигурационные файлы. После этого можно закрыть браузер и продолжить настройку.

Типичные проблемы:

  • Ошибка о несоответствии голосовой модели — это нормально, если модель не найдена, Mantella использует любую доступную. В логе будет ошибка, но диалог продолжит работать.
  • Медленная генерация ответов — если используется локальная модель, скорость зависит от мощности видеокарты. На видеокартах AMD локальные модели могут не работать, потребуется CPU-режим (медленнее).
  • NPC не реагируют на голос — проверьте, что микрофон выбран в настройках xVASynth и в системе, а также что microphone_enabled = 1 в конфиге Mantella.
  • Проблемы с русским языком — убедитесь, что установлен Russian Dictionary для xVASynth и что в настройках Mantella указан language = ru.

Ограничения, требования к ПК и перспективы технологии

Нейросетевые моды предъявляют серьезные требования к оборудованию. Для локального запуска LLM потребуется видеокарта NVIDIA не ниже GTX 1660 с достаточным объемом видеопамяти. На видеокартах AMD локальные модели работать не будут, хотя возможен запуск на процессоре, но это будет очень медленно.

Объем занимаемого места также значителен: при установке всех голосовых моделей xVASynth мод может занимать около 17 ГБ, а для распаковки потребуется до 32 ГБ свободного места. Это стоит учитывать при планировании установки.

Важно понимать ограничения технологии. ИИ-диалоги не влияют на сюжет игры, не добавляют и не удаляют квесты. Это скорее развлекательная функция, которая повышает уровень погружения. NPC могут шутить, рассказывать истории, реагировать на действия игрока, но они не изменяют игровой мир.

Тем не менее, технология быстро развивается. Уже сейчас NPC могут запоминать разговоры на протяжении нескольких дней, поддерживать заданный профиль общения и даже «видеть» окружающий мир с помощью моделей графического распознавания. В будущем можно ожидать, что нейросетевые моды станут неотъемлемой частью RPG, стирая грань между игроком и виртуальными персонажами.

Вопросы и ответы

Какая версия Skyrim лучше всего подходит для установки нейросетевых модов?

Рекомендуется использовать GOG-версию Skyrim Special Edition. Она не имеет DRM-защиты, что снижает риск конфликтов с модами, особенно с теми, которые требуют глубокой интеграции в игровой процесс. Steam-версия также может работать, но с ней возникает больше проблем с совместимостью.

Можно ли использовать нейросетевые моды без подключения к интернету?

Да, можно. Для этого необходимо использовать локальную языковую модель, запускаемую через KoboldCpp. Это бесплатный и автономный вариант, который не требует подключения к облачным сервисам. Однако он предъявляет требования к видеокарте (NVIDIA GTX 1660 или выше) и объему оперативной памяти.

Сколько места на диске потребуется для установки всех компонентов?

При установке всех голосовых моделей xVASynth мод может занимать около 17 ГБ. Для распаковки моделей потребуется до 32 ГБ свободного места. Также необходимо учесть размер языковой модели (около 500 МБ для koboldcpp.exe и несколько гигабайт для файла GGUF) и самих модов.

Помнят ли NPC предыдущие разговоры с игроком?

Да, помнят. Благодаря использованию больших языковых моделей с достаточным размером контекста (рекомендуется 8192 токенов), NPC могут запоминать предыдущие диалоги и ссылаться на них. Например, если вы украли лошадь в Вайтране, торговец может припомнить это при следующей встрече.

Влияют ли ИИ-диалоги на сюжет игры и квесты?

Нет, на данный момент ИИ-диалоги не влияют на сюжет, не добавляют и не удаляют квесты. Это развлекательная функция, которая повышает уровень погружения. NPC могут генерировать уникальные ответы, но игровой мир остается статичным. Однако технология развивается, и в будущем возможна более глубокая интеграция.

Что делать, если NPC не реагируют на голосовой ввод?

Проверьте несколько параметров: убедитесь, что в настройках xVASynth выбран правильный микрофон, в конфигурационном файле Mantella параметр microphone_enabled установлен в 1, и что в системных настройках Windows микрофон работает корректно. Также проверьте, что в xVASynth в настройках выбран правильный аудиоустройство для вывода.

Какие видеокарты поддерживают локальный запуск языковых моделей?

Для локального запуска LLM через KoboldCpp требуются видеокарты NVIDIA с поддержкой CUDA, не ниже GTX 1660. На видеокартах AMD локальные модели работать не будут. Возможен запуск на процессоре, но это будет очень медленно и может сделать игру некомфортной.