大模型选择

核心结论

目前市面上的主流旗舰模型都能够完成 NocoBase 应用的主体搭建。

不同模型在单次产物的完整度、耗时和问题数量上有所差异,可以结合已有的模型服务、所在地区的网络条件、使用成本和团队习惯自主选择。

本次使用一套标准的 CRM(销售机会与客户跟进系统)需求,对不同模型的搭建产物进行验收:

测评维度标准化测评项
14 个61 个

测评维度

本次测评覆盖 NocoBase 的基础能力、配置能力和基础组件,同时检查模型是否能够理解需求并执行对应的搭建任务。

能力评测关注点
数据建模数据表、字段类型、关联关系、必填、唯一和默认值
页面与功能导航、列表、表单、详情、搜索、筛选和数据看板
业务逻辑状态流转、业务校验、计算规则和关联数据一致性
权限与安全角色、菜单权限、操作权限、数据范围和字段权限
工作流自动化触发器、节点、条件分支、通知、数据副作用和失败重试
界面体验信息架构、表单体验、操作反馈和响应式布局
稳健性非法输入、重复提交、失败一致性、数据规模和网络恢复
需求覆盖明确需求和核心业务路径是否完整实现
合理扩展模型主动增加的功能是否具有明确业务用途
范围控制是否存在重复、闲置或超出需求范围的业务模块

测评结果

测评维度GPT-5.6 SolDeepSeek-V4-FlashQwen3.8-MaxGPT-5.6 Luna
数据建模✓ 通过✓ 通过✓ 通过✓ 通过
功能完成✓ 通过✓ 通过✓ 通过◐ 部分通过
业务逻辑✓ 通过✓ 通过✓ 通过✓ 通过
权限安全✓ 通过✓ 通过✓ 通过✓ 通过
工作流自动化✓ 通过✓ 通过✓ 通过✓ 通过
界面体验✓ 通过✓ 通过✓ 通过◐ 部分通过
稳健性✓ 通过✓ 通过✓ 通过✓ 通过
需求覆盖✓ 通过✓ 通过✓ 通过◐ 部分通过
合理扩展✓ 通过✓ 通过✓ 通过✓ 通过
范围控制✓ 通过✓ 通过✓ 通过✓ 通过
搭建速度较快较快最快
单次质量评分90919077
单次质量评分

单次质量评分满分为 100 分,首次完整验收每发现 1 个 Bug 扣 1 分,用于观察模型一次搭建的产物质量。通过后续反馈和修改,模型可以闭环修复这些问题。

搭建耗时提示

搭建耗时会受到电脑硬件性能、依赖安装与 Build 编译、模型服务响应速度和网络条件等因素影响。

测评项明细

61 个标准化测评项分为三层:搭建结果质量 46 项、需求理解与合理扩展 7 项、搭建过程效能 8 项。每一项均使用统一的检查方法和通过条件。

第一层:搭建结果质量(46 项)

测评维度标准化测评项
数据建模(8 项)DM-01 必需集合是否全部创建
DM-02 必需字段是否存在
DM-03 字段类型是否正确
DM-04 一对一关系能否创建和使用
DM-05 一对多关系能否创建和使用
DM-06 多对多关系能否创建和使用
DM-07 必填、唯一和默认值是否生效
DM-08 关联数据能否查看和筛选
功能完成(6 项)FC-01 必需页面与导航入口是否齐全
FC-02 记录新增、查看、编辑和删除是否可用
FC-03 核心用户路径能否完整走通
FC-04 关键业务动作是否具备
FC-05 搜索、筛选和排序是否可用
FC-06 统计看板是否具备规定内容
业务逻辑(6 项)BL-01 商机状态流转规则是否正确
BL-02 业务校验规则是否生效
BL-03 计算字段与统计口径是否正确
BL-04 线索转化后的数据映射是否正确
BL-05 关联记录更新是否保持一致
BL-06 删除与归档规则是否正确
权限安全(7 项)ACL-01 必需角色是否全部创建
ACL-02 测试用户与角色分配是否正确
ACL-03 页面与菜单访问权限是否正确
ACL-04 数据操作权限是否正确
ACL-05 记录级数据范围是否正确
ACL-06 字段级查看与编辑权限是否正确
ACL-07 角色变更与多角色叠加是否正确
工作流自动化(7 项)WF-01 必需工作流是否创建并启用
WF-02 工作流触发器设计是否正确
WF-03 节点顺序与数据传递是否正确
WF-04 条件与分支结果是否正确
WF-05 记录读写副作用是否正确
WF-06 通知对象与内容是否正确
WF-07 失败日志与重试行为是否可追踪
界面体验(7 项)UX-01 导航与信息架构是否清晰
UX-02 列表信息与常用操作是否易用
UX-03 表单分组、顺序与提示是否清晰
UX-04 详情页是否支持理解和继续操作
UX-05 操作反馈与状态变化是否明确
UX-06 不同屏幕宽度下是否可用
UX-07 空数据、加载和错误状态是否完整
稳健性(5 项)ROB-01 非法与边界输入是否安全处理
ROB-02 重复提交是否产生重复副作用
ROB-03 执行失败时是否保持数据一致
ROB-04 空数据与大数据量下是否可用
ROB-05 会话或网络中断后是否可恢复

第二层:需求理解与合理扩展(7 项)

测评维度标准化测评项
需求覆盖(3 项)COV-01 提示词要求的页面与操作是否全部实现
COV-02 提示词要求的数据、权限和工作流是否全部实现
COV-03 主流程必需但提示词未逐项规定的能力是否具备
合理扩展(2 项)EXT-01 主动补充的字段、关系和规则是否必要
EXT-02 主动增加的页面、操作和统计是否有明确用途
范围控制(2 项)SCOPE-01 是否生成重复或未被使用的功能与配置
SCOPE-02 是否增加与任务范围无关的业务模块

第三层:搭建过程效能(8 项)

测评维度标准化测评项
首次可用(1 项)EFF-FIRST-01 达到首次可用所需时间
收敛效率(3 项)EFF-FINAL-01 达到最终验收所需轮次
EFF-FINAL-02 达到最终状态所需总时间
EFF-FINAL-03 达到最终状态消耗的 Token
人工干预(1 项)EFF-HUMAN-01 评测过程中发生了多少次人工干预
重复稳定性(3 项)EFF-STABLE-01 同任务重复运行的验收结果是否一致
EFF-STABLE-02 三次生成的集合、关系、角色和工作流是否一致
EFF-STABLE-03 轮次与耗时波动是否可控

接下来