Choix du LLM

Conclusion principale

Les principaux modèles phares actuellement disponibles sur le marché permettent tous de créer le socle d’une application NocoBase.

Les modèles diffèrent par l’exhaustivité de leur résultat initial, le temps de création et le nombre de problèmes rencontrés. Faites votre choix en fonction des services de modèles dont vous disposez déjà, des conditions réseau dans votre région, du coût et des préférences de votre équipe.

Cette évaluation s’appuie sur un cahier des charges CRM standardisé (un système de suivi des opportunités commerciales et des clients) afin de valider les applications créées par différents modèles :

Dimensions d’évaluationÉléments d’évaluation standardisés
1461

Dimensions d’évaluation

L’évaluation couvre les fonctionnalités essentielles, les possibilités de configuration et les composants fondamentaux de NocoBase. Elle vérifie également si chaque modèle comprend les exigences et exécute les tâches de création correspondantes.

CapacitéPoints évalués
Modélisation des donnéesCollections, types de champs, relations, contraintes obligatoires et d’unicité, et valeurs par défaut
Pages et fonctionnalitésNavigation, listes, formulaires, pages de détail, recherche, filtres et tableaux de bord
Logique métierTransitions d’état, validations métier, règles de calcul et cohérence des données liées
Permissions et sécuritéRôles, permissions des menus, permissions d’action, périmètres de données et permissions des champs
Automatisation des workflowsDéclencheurs, nœuds, branches conditionnelles, notifications, effets de bord sur les données et nouvelles tentatives après échec
Expérience utilisateurArchitecture de l’information, ergonomie des formulaires, retour sur les actions et mises en page adaptatives
RobustesseEntrées non valides, soumissions en double, cohérence en cas d’échec, volume de données et reprise après une interruption réseau
Couverture des exigencesMise en œuvre complète des exigences explicites et des principaux parcours métier
Extensions pertinentesUtilité métier clairement établie des fonctionnalités ajoutées de manière proactive par le modèle
Contrôle du périmètreAbsence de modules métier en double, inutilisés ou hors périmètre dans le résultat

Résultats de l’évaluation

Dimension d’évaluationGPT-5.6 SolDeepSeek-V4-FlashQwen3.8-MaxGPT-5.6 Luna
Modélisation des données✓ Réussi✓ Réussi✓ Réussi✓ Réussi
Réalisation des fonctionnalités✓ Réussi✓ Réussi✓ Réussi◐ Partiellement réussi
Logique métier✓ Réussi✓ Réussi✓ Réussi✓ Réussi
Permissions et sécurité✓ Réussi✓ Réussi✓ Réussi✓ Réussi
Automatisation des workflows✓ Réussi✓ Réussi✓ Réussi✓ Réussi
Expérience utilisateur✓ Réussi✓ Réussi✓ Réussi◐ Partiellement réussi
Robustesse✓ Réussi✓ Réussi✓ Réussi✓ Réussi
Couverture des exigences✓ Réussi✓ Réussi✓ Réussi◐ Partiellement réussi
Extensions pertinentes✓ Réussi✓ Réussi✓ Réussi✓ Réussi
Contrôle du périmètre✓ Réussi✓ Réussi✓ Réussi✓ Réussi
Vitesse de créationAssez rapideAssez rapideLentLe plus rapide
Score de qualité sur une exécution90919077
Score de qualité sur une exécution

Le score de qualité sur une exécution est calculé sur 100 points. Un point est retranché pour chaque bug détecté lors de la première vérification complète, ce qui donne une indication de la qualité du résultat initial produit par le modèle. Le modèle peut résoudre ces problèmes grâce aux retours et aux révisions ultérieurs.

Remarque sur le temps de création

Le temps de création dépend de facteurs tels que les performances matérielles de l’ordinateur, l’installation des dépendances et la compilation du projet, le temps de réponse du service de modèles et les conditions réseau.

Détail des éléments d’évaluation

Les 61 éléments d’évaluation standardisés sont organisés en trois niveaux : 46 portent sur la qualité du résultat de la création, 7 sur la compréhension des exigences et les extensions pertinentes, et 8 sur l’efficacité du processus de création. Tous les éléments utilisent des méthodes de vérification et des critères de réussite cohérents.

Niveau 1 : qualité du résultat de la création (46 éléments)

Dimension d’évaluationÉléments d’évaluation standardisés
Modélisation des données (8 éléments)DM-01 Vérifier que toutes les collections requises sont créées
DM-02 Vérifier que tous les champs requis existent
DM-03 Vérifier que les types de champs sont corrects
DM-04 Vérifier que les relations un-à-un peuvent être créées et utilisées
DM-05 Vérifier que les relations un-à-plusieurs peuvent être créées et utilisées
DM-06 Vérifier que les relations plusieurs-à-plusieurs peuvent être créées et utilisées
DM-07 Vérifier que les règles de champ obligatoire, d’unicité et de valeur par défaut prennent effet
DM-08 Vérifier que les données liées peuvent être consultées et filtrées
Réalisation des fonctionnalités (6 éléments)FC-01 Vérifier que toutes les pages et entrées de navigation requises sont présentes
FC-02 Vérifier que les enregistrements peuvent être créés, consultés, modifiés et supprimés
FC-03 Vérifier que les principaux parcours utilisateur peuvent être accomplis de bout en bout
FC-04 Vérifier que les principales actions métier sont disponibles
FC-05 Vérifier que la recherche, le filtrage et le tri sont disponibles
FC-06 Vérifier que les tableaux de bord contiennent les informations requises
Logique métier (6 éléments)BL-01 Vérifier que les règles de transition d’état des opportunités sont correctes
BL-02 Vérifier que les règles de validation métier prennent effet
BL-03 Vérifier que les champs calculés et les définitions statistiques sont corrects
BL-04 Vérifier que les données sont correctement mises en correspondance après la conversion d’un prospect
BL-05 Vérifier que les mises à jour des enregistrements liés restent cohérentes
BL-06 Vérifier que les règles de suppression et d’archivage sont correctes
Permissions et sécurité (7 éléments)ACL-01 Vérifier que tous les rôles requis sont créés
ACL-02 Vérifier que les utilisateurs de test et l’attribution des rôles sont corrects
ACL-03 Vérifier que les permissions d’accès aux pages et aux menus sont correctes
ACL-04 Vérifier que les permissions relatives aux opérations sur les données sont correctes
ACL-05 Vérifier que les périmètres de données au niveau des enregistrements sont corrects
ACL-06 Vérifier que les permissions de consultation et de modification au niveau des champs sont correctes
ACL-07 Vérifier que les changements et les combinaisons de rôles se comportent correctement
Automatisation des workflows (7 éléments)WF-01 Vérifier que tous les workflows requis sont créés et activés
WF-02 Vérifier que les déclencheurs de workflow sont correctement conçus
WF-03 Vérifier que l’ordre des nœuds et le transfert des données sont corrects
WF-04 Vérifier que les conditions et les résultats des branches sont corrects
WF-05 Vérifier que les effets de bord de lecture et d’écriture des enregistrements sont corrects
WF-06 Vérifier que les destinataires et le contenu des notifications sont corrects
WF-07 Vérifier que les journaux d’échec et le comportement des nouvelles tentatives sont traçables
Expérience utilisateur (7 éléments)UX-01 Vérifier que la navigation et l’architecture de l’information sont claires
UX-02 Vérifier que les informations des listes et les actions courantes sont faciles à utiliser
UX-03 Vérifier que le regroupement, l’ordre et les indications des formulaires sont clairs
UX-04 Vérifier que les pages de détail facilitent la compréhension et les actions de suivi
UX-05 Vérifier que le retour sur les actions et les changements d’état sont clairs
UX-06 Vérifier que l’application reste utilisable avec différentes largeurs d’écran
UX-07 Vérifier que les états vide, de chargement et d’erreur sont complets
Robustesse (5 éléments)ROB-01 Vérifier que les entrées non valides et les valeurs limites sont traitées de manière sûre
ROB-02 Vérifier que les soumissions en double ne provoquent pas d’effets de bord en double
ROB-03 Vérifier que les données restent cohérentes en cas d’échec de l’exécution
ROB-04 Vérifier que l’application reste utilisable avec des jeux de données vides ou volumineux
ROB-05 Vérifier que l’application peut reprendre après l’interruption d’une session ou du réseau

Niveau 2 : compréhension des exigences et extensions pertinentes (7 éléments)

Dimension d’évaluationÉléments d’évaluation standardisés
Couverture des exigences (3 éléments)COV-01 Vérifier que toutes les pages et actions demandées dans le prompt sont mises en œuvre
COV-02 Vérifier que toutes les données, permissions et tous les workflows demandés dans le prompt sont mis en œuvre
COV-03 Vérifier que les capacités nécessaires au processus principal, mais non précisées individuellement dans le prompt, sont présentes
Extensions pertinentes (2 éléments)EXT-01 Vérifier que les champs, relations et règles ajoutés de manière proactive sont nécessaires
EXT-02 Vérifier que les pages, actions et statistiques ajoutées de manière proactive répondent à un objectif clair
Contrôle du périmètre (2 éléments)SCOPE-01 Vérifier qu’aucune fonctionnalité ou configuration en double ou inutilisée n’est générée
SCOPE-02 Vérifier qu’aucun module métier sans rapport avec le périmètre de la tâche n’est ajouté

Niveau 3 : efficacité du processus de création (8 éléments)

Dimension d’évaluationÉléments d’évaluation standardisés
Délai avant le premier résultat utilisable (1 élément)EFF-FIRST-01 Temps nécessaire pour obtenir le premier résultat utilisable
Efficacité de la convergence (3 éléments)EFF-FINAL-01 Nombre d’itérations nécessaires pour obtenir la validation finale
EFF-FINAL-02 Temps total nécessaire pour atteindre l’état final
EFF-FINAL-03 Nombre de tokens consommés pour atteindre l’état final
Intervention humaine (1 élément)EFF-HUMAN-01 Nombre d’interventions humaines au cours de l’évaluation
Reproductibilité (3 éléments)EFF-STABLE-01 Vérifier que les exécutions répétées d’une même tâche produisent des résultats de validation cohérents
EFF-STABLE-02 Vérifier que les collections, les relations, les rôles et les workflows sont cohérents sur trois exécutions
EFF-STABLE-03 Vérifier que la variation du nombre d’itérations et de la durée reste maîtrisée

Étapes suivantes