LLM-Auswahl

Wichtigste Erkenntnis

Die derzeit marktführenden Flaggschiffmodelle können alle den Kern einer NocoBase-Anwendung aufbauen.

Die Modelle unterscheiden sich hinsichtlich der Vollständigkeit ihrer ersten Ausgabe, der Aufbauzeit und der Anzahl der Probleme. Wählen Sie ein Modell anhand der bereits verfügbaren Modelldienste, der Netzwerkbedingungen in Ihrer Region, der Kosten und der Präferenzen Ihres Teams aus.

Für diese Bewertung wurde ein standardisierter CRM-Anforderungskatalog (ein System zur Verwaltung von Verkaufschancen und zur Kundennachverfolgung) verwendet, um die von verschiedenen Modellen aufgebauten Anwendungen zu überprüfen:

BewertungsdimensionenStandardisierte Prüfpunkte
1461

Bewertungsdimensionen

Die Bewertung umfasst die Kernfunktionen, Konfigurationsmöglichkeiten und Basiskomponenten von NocoBase. Außerdem wird geprüft, ob jedes Modell die Anforderungen verstehen und die entsprechenden Aufbauaufgaben ausführen kann.

FähigkeitBewertungsschwerpunkt
DatenmodellierungCollections, Feldtypen, Beziehungen, Pflichtfeld- und Eindeutigkeitsregeln sowie Standardwerte
Seiten und FunktionenNavigation, Listen, Formulare, Detailansichten, Suche, Filter und Dashboards
GeschäftslogikStatusübergänge, Geschäftsvalidierung, Berechnungsregeln und Konsistenz verknüpfter Daten
Berechtigungen und SicherheitRollen, Menüberechtigungen, Aktionsberechtigungen, Datenbereiche und Feldberechtigungen
Workflow-AutomatisierungTrigger, Knoten, bedingte Verzweigungen, Benachrichtigungen, Datenseiteneffekte und Wiederholungsversuche bei Fehlern
BenutzerfreundlichkeitInformationsarchitektur, Formularbedienung, Aktionsfeedback und responsive Layouts
RobustheitUngültige Eingaben, doppelte Übermittlungen, Konsistenz bei Fehlern, Datenvolumen und Wiederherstellung nach Netzwerkunterbrechungen
AnforderungsabdeckungOb explizite Anforderungen und zentrale Geschäftsabläufe vollständig umgesetzt sind
Sinnvolle ErweiterungenOb vom Modell proaktiv hinzugefügte Funktionen einem klaren Geschäftszweck dienen
UmfangskontrolleOb das Ergebnis doppelte, ungenutzte oder außerhalb des vorgesehenen Umfangs liegende Geschäftsmodule enthält

Bewertungsergebnisse

BewertungsdimensionGPT-5.6 SolDeepSeek-V4-FlashQwen3.8-MaxGPT-5.6 Luna
Datenmodellierung✓ Bestanden✓ Bestanden✓ Bestanden✓ Bestanden
Funktionsvollständigkeit✓ Bestanden✓ Bestanden✓ Bestanden◐ Teilweise bestanden
Geschäftslogik✓ Bestanden✓ Bestanden✓ Bestanden✓ Bestanden
Berechtigungen und Sicherheit✓ Bestanden✓ Bestanden✓ Bestanden✓ Bestanden
Workflow-Automatisierung✓ Bestanden✓ Bestanden✓ Bestanden✓ Bestanden
Benutzerfreundlichkeit✓ Bestanden✓ Bestanden✓ Bestanden◐ Teilweise bestanden
Robustheit✓ Bestanden✓ Bestanden✓ Bestanden✓ Bestanden
Anforderungsabdeckung✓ Bestanden✓ Bestanden✓ Bestanden◐ Teilweise bestanden
Sinnvolle Erweiterungen✓ Bestanden✓ Bestanden✓ Bestanden✓ Bestanden
Umfangskontrolle✓ Bestanden✓ Bestanden✓ Bestanden✓ Bestanden
AufbaugeschwindigkeitRelativ schnellRelativ schnellLangsamAm schnellsten
Qualitätsbewertung eines einzelnen Durchlaufs90919077
Qualitätsbewertung eines einzelnen Durchlaufs

Die Qualitätsbewertung eines einzelnen Durchlaufs hat eine Höchstpunktzahl von 100 Punkten. Für jeden bei der ersten vollständigen Abnahme gefundenen Fehler wird ein Punkt abgezogen. Der Wert gibt damit einen Anhaltspunkt für die Qualität des ersten Aufbaus durch das Modell. Durch anschließendes Feedback und weitere Überarbeitungen kann das Modell diese Probleme beheben.

Hinweis zur Aufbauzeit

Die Aufbauzeit wird unter anderem von der Hardwareleistung des Computers, der Installation von Abhängigkeiten und der Build-Kompilierung, der Antwortgeschwindigkeit des Modelldienstes sowie den Netzwerkbedingungen beeinflusst.

Details der Prüfpunkte

Die 61 standardisierten Prüfpunkte sind in drei Ebenen gegliedert: 46 Punkte für die Qualität des Aufbauergebnisses, 7 für das Verständnis der Anforderungen und sinnvolle Erweiterungen sowie 8 für die Effizienz des Aufbauprozesses. Für jeden Prüfpunkt gelten einheitliche Prüfmethoden und Bestehenskriterien.

Ebene 1: Qualität des Aufbauergebnisses (46 Prüfpunkte)

BewertungsdimensionStandardisierte Prüfpunkte
Datenmodellierung (8 Prüfpunkte)DM-01 Ob alle erforderlichen Collections erstellt wurden
DM-02 Ob alle erforderlichen Felder vorhanden sind
DM-03 Ob die Feldtypen korrekt sind
DM-04 Ob Eins-zu-eins-Beziehungen erstellt und verwendet werden können
DM-05 Ob Eins-zu-viele-Beziehungen erstellt und verwendet werden können
DM-06 Ob Viele-zu-viele-Beziehungen erstellt und verwendet werden können
DM-07 Ob Pflichtfeld-, Eindeutigkeits- und Standardwertregeln wirksam sind
DM-08 Ob verknüpfte Daten angezeigt und gefiltert werden können
Funktionsvollständigkeit (6 Prüfpunkte)FC-01 Ob alle erforderlichen Seiten und Navigationseinträge vorhanden sind
FC-02 Ob Datensätze erstellt, angezeigt, bearbeitet und gelöscht werden können
FC-03 Ob zentrale Benutzerabläufe vollständig durchlaufen werden können
FC-04 Ob wichtige Geschäftsaktionen verfügbar sind
FC-05 Ob Suche, Filterung und Sortierung verfügbar sind
FC-06 Ob Dashboards die erforderlichen Inhalte enthalten
Geschäftslogik (6 Prüfpunkte)BL-01 Ob die Regeln für Statusübergänge von Verkaufschancen korrekt sind
BL-02 Ob die Geschäftsvalidierungsregeln wirksam sind
BL-03 Ob berechnete Felder und statistische Definitionen korrekt sind
BL-04 Ob Daten nach der Umwandlung eines Leads korrekt zugeordnet werden
BL-05 Ob Aktualisierungen verknüpfter Datensätze konsistent bleiben
BL-06 Ob Lösch- und Archivierungsregeln korrekt sind
Berechtigungen und Sicherheit (7 Prüfpunkte)ACL-01 Ob alle erforderlichen Rollen erstellt wurden
ACL-02 Ob Testbenutzer und Rollenzuweisungen korrekt sind
ACL-03 Ob die Zugriffsberechtigungen für Seiten und Menüs korrekt sind
ACL-04 Ob die Berechtigungen für Datenoperationen korrekt sind
ACL-05 Ob die Datenbereiche auf Datensatzebene korrekt sind
ACL-06 Ob die Anzeige- und Bearbeitungsberechtigungen auf Feldebene korrekt sind
ACL-07 Ob Rollenänderungen und kombinierte Rollen korrekt funktionieren
Workflow-Automatisierung (7 Prüfpunkte)WF-01 Ob alle erforderlichen Workflows erstellt und aktiviert wurden
WF-02 Ob die Workflow-Trigger korrekt konzipiert sind
WF-03 Ob die Reihenfolge der Knoten und die Datenübertragung korrekt sind
WF-04 Ob Bedingungen und Verzweigungsergebnisse korrekt sind
WF-05 Ob die Seiteneffekte beim Lesen und Schreiben von Datensätzen korrekt sind
WF-06 Ob Empfänger und Inhalt von Benachrichtigungen korrekt sind
WF-07 Ob Fehlerprotokolle und das Verhalten bei Wiederholungsversuchen nachvollziehbar sind
Benutzerfreundlichkeit (7 Prüfpunkte)UX-01 Ob Navigation und Informationsarchitektur klar sind
UX-02 Ob Listeninformationen und häufige Aktionen einfach zu verwenden sind
UX-03 Ob Gruppierung, Reihenfolge und Hinweise in Formularen klar sind
UX-04 Ob Detailseiten das Verständnis und nachfolgende Aktionen unterstützen
UX-05 Ob Aktionsfeedback und Statusänderungen klar sind
UX-06 Ob die Anwendung bei verschiedenen Bildschirmbreiten nutzbar ist
UX-07 Ob Leer-, Lade- und Fehlerzustände vollständig umgesetzt sind
Robustheit (5 Prüfpunkte)ROB-01 Ob ungültige Eingaben und Grenzwerte sicher verarbeitet werden
ROB-02 Ob doppelte Übermittlungen doppelte Seiteneffekte verursachen
ROB-03 Ob die Daten bei einem Ausführungsfehler konsistent bleiben
ROB-04 Ob die Anwendung mit leeren und großen Datensätzen weiterhin nutzbar ist
ROB-05 Ob sich die Anwendung nach einer Sitzungs- oder Netzwerkunterbrechung wiederherstellen kann

Ebene 2: Anforderungsverständnis und sinnvolle Erweiterungen (7 Prüfpunkte)

BewertungsdimensionStandardisierte Prüfpunkte
Anforderungsabdeckung (3 Prüfpunkte)COV-01 Ob alle im Prompt angeforderten Seiten und Aktionen umgesetzt sind
COV-02 Ob alle im Prompt angeforderten Daten, Berechtigungen und Workflows umgesetzt sind
COV-03 Ob die für den Hauptprozess erforderlichen, aber im Prompt nicht einzeln genannten Funktionen vorhanden sind
Sinnvolle Erweiterungen (2 Prüfpunkte)EXT-01 Ob proaktiv hinzugefügte Felder, Beziehungen und Regeln erforderlich sind
EXT-02 Ob proaktiv hinzugefügte Seiten, Aktionen und Statistiken einem klaren Zweck dienen
Umfangskontrolle (2 Prüfpunkte)SCOPE-01 Ob doppelte oder ungenutzte Funktionen und Konfigurationen erzeugt werden
SCOPE-02 Ob Geschäftsmodule hinzugefügt werden, die nicht zum Aufgabenbereich gehören

Ebene 3: Effizienz des Aufbauprozesses (8 Prüfpunkte)

BewertungsdimensionStandardisierte Prüfpunkte
Zeit bis zum ersten nutzbaren Ergebnis (1 Prüfpunkt)EFF-FIRST-01 Benötigte Zeit bis zum ersten nutzbaren Ergebnis
Konvergenzeffizienz (3 Prüfpunkte)EFF-FINAL-01 Anzahl der Iterationen bis zur endgültigen Abnahme
EFF-FINAL-02 Gesamtdauer bis zum Erreichen des Endzustands
EFF-FINAL-03 Token-Verbrauch bis zum Erreichen des Endzustands
Manuelle Eingriffe (1 Prüfpunkt)EFF-HUMAN-01 Anzahl der manuellen Eingriffe während der Bewertung
Wiederholbarkeit (3 Prüfpunkte)EFF-STABLE-01 Ob wiederholte Ausführungen derselben Aufgabe zu konsistenten Abnahmeergebnissen führen
EFF-STABLE-02 Ob Collections, Beziehungen, Rollen und Workflows über drei Durchläufe hinweg konsistent sind
EFF-STABLE-03 Ob Schwankungen bei der Anzahl der Iterationen und der benötigten Zeit kontrolliert bleiben

Nächste Schritte