Выбор большой языковой модели

Главный вывод

Все представленные на рынке ведущие флагманские модели способны создать основную часть приложения NocoBase.

Модели различаются полнотой первоначального результата, временем создания и количеством проблем. При выборе можно учитывать уже доступные модельные сервисы, качество сети в вашем регионе, стоимость и предпочтения команды.

Для оценки использовался стандартизированный набор требований к CRM (системе управления возможностями продаж и сопровождения клиентов), по которому проверялись приложения, созданные разными моделями:

Измерения оценкиСтандартизированные критерии оценки
1461

Измерения оценки

Оценка охватывает основные возможности, средства настройки и базовые компоненты NocoBase. Кроме того, она проверяет, способна ли каждая модель понять требования и выполнить соответствующие задачи по созданию приложения.

ВозможностьЧто оценивается
Моделирование данныхКоллекции, типы полей, связи, ограничения обязательности и уникальности, значения по умолчанию
Страницы и функцииНавигация, списки, формы, подробные представления, поиск, фильтры и информационные панели
Бизнес-логикаПереходы между статусами, бизнес-валидация, правила вычислений и согласованность связанных данных
Права доступа и безопасностьРоли, права доступа к меню, права на действия, области данных и права доступа к полям
Автоматизация рабочих процессовТриггеры, узлы, условные ветви, уведомления, побочные изменения данных и повторные попытки после сбоев
Пользовательский опытИнформационная архитектура, удобство форм, обратная связь при выполнении действий и адаптивные макеты
НадёжностьНекорректный ввод, повторная отправка, согласованность при сбоях, объём данных и восстановление после сетевых сбоев
Покрытие требованийПолностью ли реализованы явные требования и основные бизнес-сценарии
Обоснованные расширенияИмеют ли функции, инициативно добавленные моделью, ясное назначение для бизнеса
Контроль границ задачиСодержит ли результат повторяющиеся, неиспользуемые или не относящиеся к задаче бизнес-модули

Результаты оценки

Измерение оценкиGPT-5.6 SolDeepSeek-V4-FlashQwen3.8-MaxGPT-5.6 Luna
Моделирование данных✓ Пройдено✓ Пройдено✓ Пройдено✓ Пройдено
Полнота функций✓ Пройдено✓ Пройдено✓ Пройдено◐ Пройдено частично
Бизнес-логика✓ Пройдено✓ Пройдено✓ Пройдено✓ Пройдено
Права доступа и безопасность✓ Пройдено✓ Пройдено✓ Пройдено✓ Пройдено
Автоматизация рабочих процессов✓ Пройдено✓ Пройдено✓ Пройдено✓ Пройдено
Пользовательский опыт✓ Пройдено✓ Пройдено✓ Пройдено◐ Пройдено частично
Надёжность✓ Пройдено✓ Пройдено✓ Пройдено✓ Пройдено
Покрытие требований✓ Пройдено✓ Пройдено✓ Пройдено◐ Пройдено частично
Обоснованные расширения✓ Пройдено✓ Пройдено✓ Пройдено✓ Пройдено
Контроль границ задачи✓ Пройдено✓ Пройдено✓ Пройдено✓ Пройдено
Скорость созданияОтносительно высокаяОтносительно высокаяНизкаяСамая высокая
Оценка качества за один запуск90919077
Оценка качества за один запуск

Максимальная оценка качества за один запуск составляет 100 баллов. За каждую ошибку, обнаруженную во время первой полной приёмочной проверки, снимается один балл. Эта оценка позволяет судить о качестве первоначального результата модели. Модель может устранить найденные проблемы в ходе последующей обратной связи и доработок.

Примечание о времени создания

Время создания зависит от таких факторов, как производительность компьютера, установка зависимостей и компиляция при выполнении Build, скорость ответа модельного сервиса и качество сетевого соединения.

Подробные критерии оценки

61 стандартизированный критерий оценки разделён на три уровня: 46 критериев качества результата, 7 критериев понимания требований и обоснованности расширений и 8 критериев эффективности процесса создания. Для всех критериев используются единые методы проверки и условия прохождения.

Уровень 1: качество результата (46 критериев)

Измерение оценкиСтандартизированные критерии оценки
Моделирование данных (8 критериев)DM-01 Созданы ли все необходимые коллекции
DM-02 Присутствуют ли все необходимые поля
DM-03 Правильно ли выбраны типы полей
DM-04 Можно ли создавать и использовать связи «один к одному»
DM-05 Можно ли создавать и использовать связи «один ко многим»
DM-06 Можно ли создавать и использовать связи «многие ко многим»
DM-07 Действуют ли правила обязательности, уникальности и значений по умолчанию
DM-08 Можно ли просматривать и фильтровать связанные данные
Полнота функций (6 критериев)FC-01 Присутствуют ли все необходимые страницы и пункты навигации
FC-02 Можно ли создавать, просматривать, редактировать и удалять записи
FC-03 Можно ли пройти основные пользовательские сценарии от начала до конца
FC-04 Доступны ли ключевые бизнес-действия
FC-05 Доступны ли поиск, фильтрация и сортировка
FC-06 Содержат ли информационные панели необходимые данные
Бизнес-логика (6 критериев)BL-01 Правильно ли работают правила перехода между статусами возможности продажи
BL-02 Действуют ли правила бизнес-валидации
BL-03 Верны ли вычисляемые поля и определения статистических показателей
BL-04 Правильно ли сопоставляются данные после преобразования лида
BL-05 Сохраняется ли согласованность при обновлении связанных записей
BL-06 Правильно ли работают правила удаления и архивирования
Права доступа и безопасность (7 критериев)ACL-01 Созданы ли все необходимые роли
ACL-02 Правильно ли настроены тестовые пользователи и назначение ролей
ACL-03 Правильно ли настроены права доступа к страницам и меню
ACL-04 Правильно ли настроены права на операции с данными
ACL-05 Правильно ли настроены области данных на уровне записей
ACL-06 Правильно ли настроены права на просмотр и редактирование на уровне полей
ACL-07 Правильно ли работают изменения и сочетания ролей
Автоматизация рабочих процессов (7 критериев)WF-01 Созданы и включены ли все необходимые рабочие процессы
WF-02 Правильно ли спроектированы триггеры рабочих процессов
WF-03 Правильны ли порядок узлов и передача данных
WF-04 Правильны ли условия и результаты ветвления
WF-05 Правильны ли побочные изменения при чтении и записи данных
WF-06 Правильно ли указаны получатели и содержимое уведомлений
WF-07 Можно ли отследить журналы сбоев и поведение повторных попыток
Пользовательский опыт (7 критериев)UX-01 Понятны ли навигация и информационная архитектура
UX-02 Удобны ли представление информации в списках и часто используемые действия
UX-03 Понятны ли группировка, порядок и подсказки в формах
UX-04 Помогают ли подробные представления понять данные и выполнить последующие действия
UX-05 Понятны ли обратная связь при выполнении действий и изменения статуса
UX-06 Удобно ли использовать приложение при разной ширине экрана
UX-07 Полноценно ли реализованы состояния отсутствия данных, загрузки и ошибки
Надёжность (5 критериев)ROB-01 Безопасно ли обрабатываются некорректные и граничные входные данные
ROB-02 Приводит ли повторная отправка к повторным побочным изменениям
ROB-03 Сохраняется ли согласованность данных при сбое выполнения
ROB-04 Остаётся ли приложение пригодным к использованию с пустыми и большими наборами данных
ROB-05 Может ли приложение восстановиться после прерывания сеанса или сетевого соединения

Уровень 2: понимание требований и обоснованные расширения (7 критериев)

Измерение оценкиСтандартизированные критерии оценки
Покрытие требований (3 критерия)COV-01 Реализованы ли все страницы и действия, указанные в запросе
COV-02 Реализованы ли все данные, права доступа и рабочие процессы, указанные в запросе
COV-03 Присутствуют ли возможности, необходимые для основного процесса, но не перечисленные в запросе отдельно
Обоснованные расширения (2 критерия)EXT-01 Необходимы ли инициативно добавленные поля, связи и правила
EXT-02 Имеют ли инициативно добавленные страницы, действия и статистические показатели ясное назначение
Контроль границ задачи (2 критерия)SCOPE-01 Созданы ли повторяющиеся или неиспользуемые функции и настройки
SCOPE-02 Добавлены ли бизнес-модули, не относящиеся к границам задачи

Уровень 3: эффективность процесса создания (8 критериев)

Измерение оценкиСтандартизированные критерии оценки
Время до первого пригодного результата (1 критерий)EFF-FIRST-01 Время, необходимое для получения первого пригодного результата
Эффективность сходимости (3 критерия)EFF-FINAL-01 Количество итераций, необходимых для окончательной приёмки
EFF-FINAL-02 Общее время, необходимое для достижения окончательного состояния
EFF-FINAL-03 Количество токенов, использованных для достижения окончательного состояния
Вмешательство человека (1 критерий)EFF-HUMAN-01 Количество вмешательств человека в ходе оценки
Воспроизводимость (3 критерия)EFF-STABLE-01 Дают ли повторные запуски одной и той же задачи согласованные результаты приёмки
EFF-STABLE-02 Одинаковы ли коллекции, связи, роли и рабочие процессы в трёх запусках
EFF-STABLE-03 Остаются ли отклонения в количестве итераций и времени в контролируемых пределах

Дальнейшие шаги