Использование Lina и локального HY-MT1.5-1.8B для перевода записей локализации
ИИ-сотрудникиCommunity Edition+В этом руководстве описан практический сценарий локализации: локально развернуть небольшую специализированную модель перевода, открыть её как OpenAI-совместимый сервис и настроить Lina для пакетного перевода записей локализации NocoBase.
Подход подходит для множества системных записей, текстов плагинов, меню, названий коллекций и подписей полей. В отличие от онлайн-моделей, локальные модели не зависят от внешних лимитов RPM, TPM и параллельности, а параллельность можно настраивать по возможностям машины и модели.
Обзор
В руководстве используются:
- Модель:
tencent/HY-MT1.5-1.8B-GGUF - Сервис инференса:
llama-server - Интеграция: OpenAI-совместимый API
- ИИ-сотрудник: Lina
- Точка входа: страница управления локализацией
HY-MT1.5-1.8B — небольшая специализированная модель перевода. Она лучше подходит для коротких записей, UI-текстов и пакетного перевода. Общие чат-модели не рекомендуется выбирать первыми для задач локализации.
Предварительная подготовка
- Плагин Управление локализацией включён.
- Целевой язык включён.
- Записи локализации синхронизированы.
- Локальная машина или сервер может запускать
llama-server. - Сервис NocoBase может обращаться к HTTP-адресу
llama-server.
Развертывание HY-MT GGUF
Установка llama.cpp
В macOS можно установить через Homebrew:
Также можно использовать готовый бинарный файл llama.cpp или собрать его из исходного кода. Главное, чтобы был доступен llama-server.
Запуск OpenAI-совместимого сервиса
Запустите сервис с GGUF-моделью из Hugging Face:
Если ресурсы сервера ограничены, начните с -np 1 или -np 2, затем постепенно увеличивайте после проверки стабильности.
Проверка сервиса модели
После запуска llama-server проверьте состояние сервиса:
Затем проверьте перевод через OpenAI-совместимый API:
Если используется локальный файл модели, замените model на фактическое имя модели, возвращаемое или настроенное сервисом.
Если запрос долго не отвечает, модель может быть слишком медленной, параллельность слишком высокой или контекст слишком большим. Сначала уменьшите -np и параллельность перевода NocoBase, затем наблюдайте время ответа.
Настройка службы языковой модели в NocoBase
Перейдите в Настройки системы -> ИИ-сотрудники -> Служба языковой модели и добавьте службу языковой модели.
После настройки используйте Тест запуска, чтобы проверить модель.
Если NocoBase запущен в Docker, 127.0.0.1 указывает на сам контейнер и может не обращаться к сервису на хосте. Используйте IP хоста, адрес контейнерной сети или host.docker.internal.
Настройка выделенной модели Lina
Перейдите в Настройки системы -> ИИ-сотрудники -> ИИ-сотрудники, откройте Lina и перейдите в Настройки модели.
- Включите
Включить настройку выделенной модели. - Выберите локальную модель HY-MT в
Модели. - Сохраните конфигурацию.
После этого Lina будет использовать эту модель для задач перевода локализации и не будет переключаться на общие чат-модели.
Подробнее см. Настройка моделей ИИ-сотрудников.
Настройка параллельности перевода
Параллельность задач перевода локализации управляется AI_LOCALIZATION_CONCURRENCY:
Правила:
- По умолчанию:
10 - Минимум:
1 - Максимум:
20 - Значения вне диапазона используют значение по умолчанию
Оптимальная параллельность зависит от CPU, GPU, памяти, квантования модели и llama-server -np. Если значение по умолчанию вызывает проблемы:
- Начните с
AI_LOCALIZATION_CONCURRENCY=1и проверьте перевод одной записи. - Установите
llama-server -npиAI_LOCALIZATION_CONCURRENCYв2или4. - Наблюдайте время ответа, загрузку CPU/GPU и прогресс задачи.
- Увеличивайте постепенно только при стабильной работе.
Не задавайте слишком высокую параллельность сразу. Если она превышает реальную ёмкость модели, задачи могут замедлиться из-за очередей, таймаутов или зависания сервиса.

