Selección de LLM

Conclusión principal

Los principales modelos insignia disponibles actualmente en el mercado pueden construir el núcleo de una aplicación NocoBase.

Los modelos difieren en la integridad de su resultado inicial, el tiempo de construcción y la cantidad de problemas. Elija uno según los servicios de modelos que ya tenga disponibles, las condiciones de red de su región, el coste y las preferencias de su equipo.

Esta evaluación utilizó un conjunto estandarizado de requisitos de CRM (un sistema de oportunidades de venta y seguimiento de clientes) para validar las aplicaciones construidas por distintos modelos:

Dimensiones de evaluaciónElementos de evaluación estandarizados
1461

Dimensiones de evaluación

La evaluación abarca las capacidades principales, las capacidades de configuración y los componentes fundamentales de NocoBase. También comprueba si cada modelo puede entender los requisitos y ejecutar las tareas de construcción correspondientes.

CapacidadAspectos evaluados
Modelado de datosColecciones, tipos de campo, relaciones, restricciones de obligatoriedad y unicidad, y valores predeterminados
Páginas y funcionesNavegación, listados, formularios, detalles, búsqueda, filtros y paneles de control
Lógica de negocioTransiciones de estado, validaciones de negocio, reglas de cálculo y coherencia de los datos relacionados
Permisos y seguridadRoles, permisos de menús, permisos de acciones, ámbitos de datos y permisos de campos
Automatización de flujos de trabajoDisparadores, nodos, ramas condicionales, notificaciones, efectos secundarios sobre los datos y reintentos tras fallos
Experiencia de usuarioArquitectura de la información, experiencia con formularios, respuesta a las acciones y diseños adaptables
RobustezEntradas no válidas, envíos duplicados, coherencia ante fallos, volumen de datos y recuperación de la red
Cobertura de requisitosSi los requisitos explícitos y los recorridos de negocio principales están implementados por completo
Extensiones razonablesSi las funciones añadidas de forma proactiva por el modelo tienen una finalidad de negocio clara
Control del alcanceSi el resultado contiene módulos de negocio duplicados, sin usar o ajenos al alcance

Resultados de la evaluación

Dimensión de evaluaciónGPT-5.6 SolDeepSeek-V4-FlashQwen3.8-MaxGPT-5.6 Luna
Modelado de datos✓ Aprobado✓ Aprobado✓ Aprobado✓ Aprobado
Finalización de funciones✓ Aprobado✓ Aprobado✓ Aprobado◐ Aprobado parcialmente
Lógica de negocio✓ Aprobado✓ Aprobado✓ Aprobado✓ Aprobado
Permisos y seguridad✓ Aprobado✓ Aprobado✓ Aprobado✓ Aprobado
Automatización de flujos de trabajo✓ Aprobado✓ Aprobado✓ Aprobado✓ Aprobado
Experiencia de usuario✓ Aprobado✓ Aprobado✓ Aprobado◐ Aprobado parcialmente
Robustez✓ Aprobado✓ Aprobado✓ Aprobado✓ Aprobado
Cobertura de requisitos✓ Aprobado✓ Aprobado✓ Aprobado◐ Aprobado parcialmente
Extensiones razonables✓ Aprobado✓ Aprobado✓ Aprobado✓ Aprobado
Control del alcance✓ Aprobado✓ Aprobado✓ Aprobado✓ Aprobado
Velocidad de construcciónRelativamente rápidaRelativamente rápidaLentaLa más rápida
Puntuación de calidad de una sola ejecución90919077
Puntuación de calidad de una sola ejecución

La puntuación de calidad de una sola ejecución tiene un máximo de 100 puntos. Se descuenta un punto por cada error detectado durante la primera comprobación completa de aceptación, lo que permite observar la calidad de la construcción inicial del modelo. El modelo puede resolver estos problemas mediante comentarios y revisiones posteriores.

Nota sobre el tiempo de construcción

El tiempo de construcción depende de factores como el rendimiento del hardware del equipo, la instalación de dependencias y la compilación del Build, la velocidad de respuesta del servicio de modelos y las condiciones de red.

Detalles de los elementos de evaluación

Los 61 elementos de evaluación estandarizados se organizan en tres capas: 46 elementos para la calidad del resultado de la construcción, 7 para la comprensión de requisitos y las extensiones razonables, y 8 para la eficiencia del proceso de construcción. Todos los elementos emplean métodos de inspección y criterios de aprobación coherentes.

Capa 1: Calidad del resultado de la construcción (46 elementos)

Dimensión de evaluaciónElementos de evaluación estandarizados
Modelado de datos (8 elementos)DM-01 Si se han creado todas las colecciones requeridas
DM-02 Si existen todos los campos requeridos
DM-03 Si los tipos de campo son correctos
DM-04 Si se pueden crear y utilizar relaciones uno a uno
DM-05 Si se pueden crear y utilizar relaciones uno a muchos
DM-06 Si se pueden crear y utilizar relaciones muchos a muchos
DM-07 Si se aplican las reglas de obligatoriedad, unicidad y valor predeterminado
DM-08 Si se pueden consultar y filtrar los datos relacionados
Finalización de funciones (6 elementos)FC-01 Si están presentes todas las páginas y entradas de navegación requeridas
FC-02 Si se pueden crear, consultar, editar y eliminar registros
FC-03 Si los recorridos principales del usuario se pueden completar de principio a fin
FC-04 Si están disponibles las acciones de negocio clave
FC-05 Si están disponibles la búsqueda, el filtrado y la ordenación
FC-06 Si los paneles de control contienen el contenido requerido
Lógica de negocio (6 elementos)BL-01 Si las reglas de transición del estado de las oportunidades son correctas
BL-02 Si se aplican las reglas de validación de negocio
BL-03 Si los campos calculados y las definiciones estadísticas son correctos
BL-04 Si los datos se asignan correctamente tras convertir un cliente potencial
BL-05 Si las actualizaciones de registros relacionados mantienen la coherencia
BL-06 Si las reglas de eliminación y archivado son correctas
Permisos y seguridad (7 elementos)ACL-01 Si se han creado todos los roles requeridos
ACL-02 Si los usuarios de prueba y las asignaciones de roles son correctos
ACL-03 Si los permisos de acceso a páginas y menús son correctos
ACL-04 Si los permisos de operación sobre los datos son correctos
ACL-05 Si los ámbitos de datos a nivel de registro son correctos
ACL-06 Si los permisos de consulta y edición a nivel de campo son correctos
ACL-07 Si los cambios de roles y las combinaciones de roles funcionan correctamente
Automatización de flujos de trabajo (7 elementos)WF-01 Si se han creado y habilitado todos los flujos de trabajo requeridos
WF-02 Si los disparadores de los flujos de trabajo están diseñados correctamente
WF-03 Si el orden de los nodos y la transferencia de datos son correctos
WF-04 Si las condiciones y los resultados de las ramas son correctos
WF-05 Si los efectos secundarios de lectura y escritura de registros son correctos
WF-06 Si los destinatarios y el contenido de las notificaciones son correctos
WF-07 Si se puede hacer un seguimiento de los registros de fallos y del comportamiento de reintento
Experiencia de usuario (7 elementos)UX-01 Si la navegación y la arquitectura de la información son claras
UX-02 Si la información de los listados y las acciones habituales son fáciles de usar
UX-03 Si la agrupación, el orden y las indicaciones de los formularios son claros
UX-04 Si las páginas de detalles facilitan la comprensión y las acciones de seguimiento
UX-05 Si la respuesta a las acciones y los cambios de estado son claros
UX-06 Si la aplicación se puede utilizar con distintos anchos de pantalla
UX-07 Si los estados vacío, de carga y de error están completos
Robustez (5 elementos)ROB-01 Si las entradas no válidas y los valores límite se gestionan de forma segura
ROB-02 Si los envíos duplicados provocan efectos secundarios duplicados
ROB-03 Si los datos mantienen su coherencia cuando falla la ejecución
ROB-04 Si la aplicación sigue siendo utilizable con conjuntos de datos vacíos y grandes
ROB-05 Si la aplicación puede recuperarse tras una interrupción de la sesión o de la red

Capa 2: Comprensión de requisitos y extensiones razonables (7 elementos)

Dimensión de evaluaciónElementos de evaluación estandarizados
Cobertura de requisitos (3 elementos)COV-01 Si se han implementado todas las páginas y acciones solicitadas en el prompt
COV-02 Si se han implementado todos los datos, permisos y flujos de trabajo solicitados en el prompt
COV-03 Si están presentes las capacidades requeridas por el proceso principal que no se especificaron individualmente en el prompt
Extensiones razonables (2 elementos)EXT-01 Si los campos, las relaciones y las reglas añadidos de forma proactiva son necesarios
EXT-02 Si las páginas, las acciones y las estadísticas añadidas de forma proactiva tienen una finalidad clara
Control del alcance (2 elementos)SCOPE-01 Si se generan funciones y configuraciones duplicadas o sin usar
SCOPE-02 Si se añaden módulos de negocio ajenos al alcance de la tarea

Capa 3: Eficiencia del proceso de construcción (8 elementos)

Dimensión de evaluaciónElementos de evaluación estandarizados
Tiempo hasta el primer resultado utilizable (1 elemento)EFF-FIRST-01 Tiempo necesario para alcanzar el primer resultado utilizable
Eficiencia de convergencia (3 elementos)EFF-FINAL-01 Número de iteraciones necesarias para alcanzar la aceptación final
EFF-FINAL-02 Tiempo total necesario para alcanzar el estado final
EFF-FINAL-03 Tokens consumidos para alcanzar el estado final
Intervención humana (1 elemento)EFF-HUMAN-01 Número de intervenciones humanas durante la evaluación
Repetibilidad (3 elementos)EFF-STABLE-01 Si las ejecuciones repetidas de la misma tarea producen resultados de aceptación coherentes
EFF-STABLE-02 Si las colecciones, las relaciones, los roles y los flujos de trabajo son coherentes en tres ejecuciones
EFF-STABLE-03 Si la variación en las iteraciones y el tiempo se mantiene controlada

Siguientes pasos