Seleção de LLM

Conclusão principal

Os principais modelos de ponta disponíveis atualmente no mercado são capazes de construir a estrutura central de uma aplicação NocoBase.

Os modelos apresentam diferenças quanto à completude do resultado inicial, ao tempo de construção e à quantidade de problemas. Escolha um modelo considerando os serviços já disponíveis, as condições de rede da sua região, o custo e as preferências da sua equipe.

Esta avaliação utilizou um conjunto padronizado de requisitos de CRM (um sistema de oportunidades de vendas e acompanhamento de clientes) para validar as aplicações construídas por diferentes modelos:

Dimensões de avaliaçãoItens de avaliação padronizados
1461

Dimensões de avaliação

A avaliação abrange os principais recursos, as capacidades de configuração e os componentes fundamentais do NocoBase. Ela também verifica se cada modelo consegue compreender os requisitos e executar as tarefas de construção correspondentes.

CapacidadeFoco da avaliação
Modelagem de dadosColeções, tipos de campo, relacionamentos, restrições obrigatórias e de unicidade e valores padrão
Páginas e funcionalidadesNavegação, listas, formulários, detalhes, pesquisa, filtros e painéis
Lógica de negócioTransições de status, validações de negócio, regras de cálculo e consistência dos dados relacionados
Permissões e segurançaPapéis, permissões de menu, permissões de ação, escopos de dados e permissões de campo
Automação de fluxos de trabalhoGatilhos, nós, ramificações condicionais, notificações, efeitos colaterais nos dados e novas tentativas após falhas
Experiência do usuárioArquitetura da informação, experiência de formulários, feedback das ações e layouts responsivos
RobustezEntradas inválidas, envios duplicados, consistência em caso de falha, volume de dados e recuperação da rede
Cobertura dos requisitosSe os requisitos explícitos e os principais fluxos de negócio foram totalmente implementados
Extensões razoáveisSe os recursos adicionados proativamente pelo modelo atendem a um objetivo de negócio claro
Controle de escopoSe o resultado contém módulos de negócio duplicados, não utilizados ou fora do escopo

Resultados da avaliação

Dimensão de avaliaçãoGPT-5.6 SolDeepSeek-V4-FlashQwen3.8-MaxGPT-5.6 Luna
Modelagem de dados✓ Aprovado✓ Aprovado✓ Aprovado✓ Aprovado
Implementação das funcionalidades✓ Aprovado✓ Aprovado✓ Aprovado◐ Parcialmente aprovado
Lógica de negócio✓ Aprovado✓ Aprovado✓ Aprovado✓ Aprovado
Permissões e segurança✓ Aprovado✓ Aprovado✓ Aprovado✓ Aprovado
Automação de fluxos de trabalho✓ Aprovado✓ Aprovado✓ Aprovado✓ Aprovado
Experiência do usuário✓ Aprovado✓ Aprovado✓ Aprovado◐ Parcialmente aprovado
Robustez✓ Aprovado✓ Aprovado✓ Aprovado✓ Aprovado
Cobertura dos requisitos✓ Aprovado✓ Aprovado✓ Aprovado◐ Parcialmente aprovado
Extensões razoáveis✓ Aprovado✓ Aprovado✓ Aprovado✓ Aprovado
Controle de escopo✓ Aprovado✓ Aprovado✓ Aprovado✓ Aprovado
Velocidade de construçãoRelativamente rápidoRelativamente rápidoLentoMais rápido
Pontuação de qualidade em uma única execução90919077
Pontuação de qualidade em uma única execução

A pontuação de qualidade em uma única execução tem o máximo de 100 pontos. Um ponto é descontado para cada bug encontrado durante a primeira verificação completa de aceitação, fornecendo uma indicação da qualidade da construção inicial do modelo. O modelo pode resolver esses problemas por meio de feedback e revisões posteriores.

Observação sobre o tempo de construção

O tempo de construção é afetado por fatores como o desempenho do hardware do computador, a instalação de dependências e a compilação do Build, a velocidade de resposta do serviço de modelo e as condições da rede.

Detalhes dos itens de avaliação

Os 61 itens de avaliação padronizados estão organizados em três camadas: 46 itens para a qualidade do resultado da construção, 7 para a compreensão dos requisitos e extensões razoáveis e 8 para a eficiência do processo de construção. Todos os itens utilizam métodos de inspeção e critérios de aprovação consistentes.

Camada 1: Qualidade do resultado da construção (46 itens)

Dimensão de avaliaçãoItens de avaliação padronizados
Modelagem de dados (8 itens)DM-01 Se todas as coleções necessárias foram criadas
DM-02 Se todos os campos necessários existem
DM-03 Se os tipos de campo estão corretos
DM-04 Se relacionamentos um para um podem ser criados e utilizados
DM-05 Se relacionamentos um para muitos podem ser criados e utilizados
DM-06 Se relacionamentos muitos para muitos podem ser criados e utilizados
DM-07 Se as regras de obrigatoriedade, unicidade e valor padrão entram em vigor
DM-08 Se os dados relacionados podem ser visualizados e filtrados
Implementação das funcionalidades (6 itens)FC-01 Se todas as páginas e entradas de navegação necessárias estão presentes
FC-02 Se os registros podem ser criados, visualizados, editados e excluídos
FC-03 Se os principais percursos do usuário podem ser concluídos de ponta a ponta
FC-04 Se as principais ações de negócio estão disponíveis
FC-05 Se pesquisa, filtragem e ordenação estão disponíveis
FC-06 Se os painéis contêm o conteúdo necessário
Lógica de negócio (6 itens)BL-01 Se as regras de transição de status das oportunidades estão corretas
BL-02 Se as regras de validação de negócio entram em vigor
BL-03 Se os campos calculados e as definições estatísticas estão corretos
BL-04 Se os dados são mapeados corretamente após a conversão do lead
BL-05 Se as atualizações dos registros relacionados permanecem consistentes
BL-06 Se as regras de exclusão e arquivamento estão corretas
Permissões e segurança (7 itens)ACL-01 Se todos os papéis necessários foram criados
ACL-02 Se os usuários de teste e as atribuições de papéis estão corretos
ACL-03 Se as permissões de acesso a páginas e menus estão corretas
ACL-04 Se as permissões de operação de dados estão corretas
ACL-05 Se os escopos de dados no nível do registro estão corretos
ACL-06 Se as permissões de visualização e edição no nível do campo estão corretas
ACL-07 Se as alterações e combinações de papéis funcionam corretamente
Automação de fluxos de trabalho (7 itens)WF-01 Se todos os fluxos de trabalho necessários foram criados e habilitados
WF-02 Se os gatilhos dos fluxos de trabalho foram projetados corretamente
WF-03 Se a ordem dos nós e a transferência de dados estão corretas
WF-04 Se as condições e os resultados das ramificações estão corretos
WF-05 Se os efeitos colaterais de leitura e gravação de registros estão corretos
WF-06 Se os destinatários e o conteúdo das notificações estão corretos
WF-07 Se os logs de falhas e o comportamento de novas tentativas são rastreáveis
Experiência do usuário (7 itens)UX-01 Se a navegação e a arquitetura da informação são claras
UX-02 Se as informações das listas e as ações comuns são fáceis de utilizar
UX-03 Se o agrupamento, a ordem e as orientações dos formulários são claros
UX-04 Se as páginas de detalhes ajudam na compreensão e nas ações de acompanhamento
UX-05 Se o feedback das ações e as mudanças de status são claros
UX-06 Se a aplicação pode ser utilizada em diferentes larguras de tela
UX-07 Se os estados vazio, de carregamento e de erro estão completos
Robustez (5 itens)ROB-01 Se entradas inválidas e de limite são tratadas com segurança
ROB-02 Se envios duplicados provocam efeitos colaterais duplicados
ROB-03 Se os dados permanecem consistentes quando a execução falha
ROB-04 Se a aplicação continua utilizável com conjuntos de dados vazios e grandes
ROB-05 Se a aplicação consegue se recuperar após a interrupção de uma sessão ou da rede

Camada 2: Compreensão dos requisitos e extensões razoáveis (7 itens)

Dimensão de avaliaçãoItens de avaliação padronizados
Cobertura dos requisitos (3 itens)COV-01 Se todas as páginas e ações solicitadas no prompt foram implementadas
COV-02 Se todos os dados, permissões e fluxos de trabalho solicitados no prompt foram implementados
COV-03 Se estão presentes os recursos exigidos pelo processo principal, mas não especificados individualmente no prompt
Extensões razoáveis (2 itens)EXT-01 Se os campos, relacionamentos e regras adicionados proativamente são necessários
EXT-02 Se as páginas, ações e estatísticas adicionadas proativamente atendem a um objetivo claro
Controle de escopo (2 itens)SCOPE-01 Se foram gerados recursos e configurações duplicados ou não utilizados
SCOPE-02 Se foram adicionados módulos de negócio que não têm relação com o escopo da tarefa

Camada 3: Eficiência do processo de construção (8 itens)

Dimensão de avaliaçãoItens de avaliação padronizados
Tempo até o primeiro resultado utilizável (1 item)EFF-FIRST-01 Tempo necessário para chegar ao primeiro resultado utilizável
Eficiência de convergência (3 itens)EFF-FINAL-01 Número de iterações necessárias para chegar à aceitação final
EFF-FINAL-02 Tempo total necessário para chegar ao estado final
EFF-FINAL-03 Tokens consumidos para chegar ao estado final
Intervenção humana (1 item)EFF-HUMAN-01 Número de intervenções humanas durante a avaliação
Repetibilidade (3 itens)EFF-STABLE-01 Se execuções repetidas da mesma tarefa produzem resultados de aceitação consistentes
EFF-STABLE-02 Se coleções, relacionamentos, papéis e fluxos de trabalho permanecem consistentes em três execuções
EFF-STABLE-03 Se a variação no número de iterações e no tempo permanece controlada

Próximos passos