Lựa chọn LLM

Kết luận chính

Các mô hình flagship hàng đầu hiện có trên thị trường đều có thể xây dựng phần cốt lõi của một ứng dụng NocoBase.

Mỗi mô hình có sự khác biệt về mức độ hoàn thiện của kết quả ban đầu, thời gian xây dựng và số lượng vấn đề. Bạn có thể lựa chọn dựa trên dịch vụ mô hình hiện có, điều kiện mạng tại khu vực, chi phí và thói quen sử dụng của đội ngũ.

Đánh giá này sử dụng một bộ yêu cầu CRM tiêu chuẩn (hệ thống quản lý cơ hội bán hàng và theo dõi khách hàng) để kiểm tra các ứng dụng do những mô hình khác nhau xây dựng:

Chiều đánh giáHạng mục đánh giá tiêu chuẩn
1461

Các chiều đánh giá

Đánh giá bao quát các năng lực cốt lõi, năng lực cấu hình và thành phần nền tảng của NocoBase. Đồng thời, đánh giá cũng kiểm tra khả năng hiểu yêu cầu và thực hiện các tác vụ xây dựng tương ứng của từng mô hình.

Năng lựcTrọng tâm đánh giá
Mô hình hóa dữ liệuBảng dữ liệu, kiểu Field, quan hệ liên kết, ràng buộc bắt buộc và duy nhất, giá trị mặc định
Trang và chức năngĐiều hướng, danh sách, biểu mẫu, chi tiết, tìm kiếm, bộ lọc và Dashboard
Logic nghiệp vụChuyển đổi trạng thái, kiểm tra hợp lệ nghiệp vụ, quy tắc tính toán và tính nhất quán của dữ liệu liên quan
Quyền và bảo mậtVai trò, quyền menu, quyền thao tác, phạm vi dữ liệu và quyền Field
Tự động hóa WorkflowTrigger, Node, nhánh điều kiện, thông báo, tác động phụ lên dữ liệu và thử lại khi thất bại
Trải nghiệm người dùngKiến trúc thông tin, trải nghiệm biểu mẫu, phản hồi thao tác và bố cục responsive
Tính ổn địnhDữ liệu đầu vào không hợp lệ, gửi trùng lặp, tính nhất quán khi thất bại, khối lượng dữ liệu và khôi phục mạng
Mức độ bao quát yêu cầuCác yêu cầu rõ ràng và luồng nghiệp vụ cốt lõi có được triển khai đầy đủ hay không
Mở rộng hợp lýCác chức năng do mô hình chủ động bổ sung có phục vụ mục đích nghiệp vụ rõ ràng hay không
Kiểm soát phạm viKết quả có chứa mô-đun nghiệp vụ trùng lặp, không được sử dụng hoặc nằm ngoài phạm vi hay không

Kết quả đánh giá

Chiều đánh giáGPT-5.6 SolDeepSeek-V4-FlashQwen3.8-MaxGPT-5.6 Luna
Mô hình hóa dữ liệu✓ Đạt✓ Đạt✓ Đạt✓ Đạt
Hoàn thiện chức năng✓ Đạt✓ Đạt✓ Đạt◐ Đạt một phần
Logic nghiệp vụ✓ Đạt✓ Đạt✓ Đạt✓ Đạt
Quyền và bảo mật✓ Đạt✓ Đạt✓ Đạt✓ Đạt
Tự động hóa Workflow✓ Đạt✓ Đạt✓ Đạt✓ Đạt
Trải nghiệm người dùng✓ Đạt✓ Đạt✓ Đạt◐ Đạt một phần
Tính ổn định✓ Đạt✓ Đạt✓ Đạt✓ Đạt
Mức độ bao quát yêu cầu✓ Đạt✓ Đạt✓ Đạt◐ Đạt một phần
Mở rộng hợp lý✓ Đạt✓ Đạt✓ Đạt✓ Đạt
Kiểm soát phạm vi✓ Đạt✓ Đạt✓ Đạt✓ Đạt
Tốc độ xây dựngKhá nhanhKhá nhanhChậmNhanh nhất
Điểm chất lượng của một lần chạy90919077
Điểm chất lượng của một lần chạy

Điểm chất lượng của một lần chạy có thang điểm tối đa là 100. Mỗi bug được phát hiện trong lần nghiệm thu đầy đủ đầu tiên sẽ bị trừ một điểm, qua đó phản ánh chất lượng của kết quả xây dựng ban đầu từ mô hình. Mô hình có thể khắc phục những vấn đề này thông qua các vòng phản hồi và chỉnh sửa tiếp theo.

Lưu ý về thời gian xây dựng

Thời gian xây dựng chịu ảnh hưởng của các yếu tố như hiệu năng phần cứng máy tính, quá trình cài đặt dependency và biên dịch Build, tốc độ phản hồi của dịch vụ mô hình và điều kiện mạng.

Chi tiết hạng mục đánh giá

61 hạng mục đánh giá tiêu chuẩn được tổ chức thành ba lớp: 46 hạng mục về chất lượng kết quả xây dựng, 7 hạng mục về khả năng hiểu yêu cầu và mở rộng hợp lý, cùng 8 hạng mục về hiệu quả của quá trình xây dựng. Mỗi hạng mục đều sử dụng phương pháp kiểm tra và tiêu chí đạt nhất quán.

Lớp 1: Chất lượng kết quả xây dựng (46 hạng mục)

Chiều đánh giáHạng mục đánh giá tiêu chuẩn
Mô hình hóa dữ liệu (8 hạng mục)DM-01 Tất cả các bảng dữ liệu bắt buộc đã được tạo hay chưa
DM-02 Tất cả các Field bắt buộc có tồn tại hay không
DM-03 Kiểu Field có chính xác hay không
DM-04 Quan hệ một-một có thể được tạo và sử dụng hay không
DM-05 Quan hệ một-nhiều có thể được tạo và sử dụng hay không
DM-06 Quan hệ nhiều-nhiều có thể được tạo và sử dụng hay không
DM-07 Các quy tắc bắt buộc, duy nhất và giá trị mặc định có hiệu lực hay không
DM-08 Dữ liệu liên quan có thể được xem và lọc hay không
Hoàn thiện chức năng (6 hạng mục)FC-01 Tất cả các trang và mục điều hướng bắt buộc có đầy đủ hay không
FC-02 Có thể tạo, xem, chỉnh sửa và xóa bản ghi hay không
FC-03 Các hành trình người dùng cốt lõi có thể được hoàn tất từ đầu đến cuối hay không
FC-04 Các thao tác nghiệp vụ quan trọng có sẵn hay không
FC-05 Chức năng tìm kiếm, lọc và sắp xếp có sẵn hay không
FC-06 Dashboard có chứa nội dung bắt buộc hay không
Logic nghiệp vụ (6 hạng mục)BL-01 Quy tắc chuyển đổi trạng thái cơ hội có chính xác hay không
BL-02 Các quy tắc kiểm tra hợp lệ nghiệp vụ có hiệu lực hay không
BL-03 Field tính toán và định nghĩa thống kê có chính xác hay không
BL-04 Dữ liệu có được ánh xạ chính xác sau khi chuyển đổi khách hàng tiềm năng hay không
BL-05 Cập nhật các bản ghi liên quan có duy trì tính nhất quán hay không
BL-06 Quy tắc xóa và lưu trữ có chính xác hay không
Quyền và bảo mật (7 hạng mục)ACL-01 Tất cả các vai trò bắt buộc đã được tạo hay chưa
ACL-02 Người dùng thử nghiệm và việc gán vai trò có chính xác hay không
ACL-03 Quyền truy cập trang và menu có chính xác hay không
ACL-04 Quyền thao tác dữ liệu có chính xác hay không
ACL-05 Phạm vi dữ liệu cấp bản ghi có chính xác hay không
ACL-06 Quyền xem và chỉnh sửa cấp Field có chính xác hay không
ACL-07 Việc thay đổi và kết hợp vai trò có hoạt động chính xác hay không
Tự động hóa Workflow (7 hạng mục)WF-01 Tất cả các Workflow bắt buộc đã được tạo và kích hoạt hay chưa
WF-02 Trigger của Workflow có được thiết kế chính xác hay không
WF-03 Thứ tự Node và quá trình truyền dữ liệu có chính xác hay không
WF-04 Điều kiện và kết quả phân nhánh có chính xác hay không
WF-05 Các tác động phụ khi đọc/ghi bản ghi có chính xác hay không
WF-06 Người nhận và nội dung thông báo có chính xác hay không
WF-07 Log lỗi và hành vi thử lại có thể truy vết hay không
Trải nghiệm người dùng (7 hạng mục)UX-01 Điều hướng và kiến trúc thông tin có rõ ràng hay không
UX-02 Thông tin danh sách và các thao tác thường dùng có dễ sử dụng hay không
UX-03 Cách nhóm, thứ tự và hướng dẫn trong biểu mẫu có rõ ràng hay không
UX-04 Trang chi tiết có hỗ trợ việc nắm bắt thông tin và thực hiện thao tác tiếp theo hay không
UX-05 Phản hồi thao tác và thay đổi trạng thái có rõ ràng hay không
UX-06 Ứng dụng có thể sử dụng được ở các độ rộng màn hình khác nhau hay không
UX-07 Trạng thái trống, đang tải và lỗi có được xử lý đầy đủ hay không
Tính ổn định (5 hạng mục)ROB-01 Dữ liệu đầu vào không hợp lệ và giá trị biên có được xử lý an toàn hay không
ROB-02 Việc gửi trùng lặp có gây ra tác động phụ trùng lặp hay không
ROB-03 Dữ liệu có duy trì tính nhất quán khi thực thi thất bại hay không
ROB-04 Ứng dụng có tiếp tục sử dụng được với tập dữ liệu trống và tập dữ liệu lớn hay không
ROB-05 Ứng dụng có thể khôi phục sau khi phiên làm việc hoặc kết nối mạng bị gián đoạn hay không

Lớp 2: Khả năng hiểu yêu cầu và mở rộng hợp lý (7 hạng mục)

Chiều đánh giáHạng mục đánh giá tiêu chuẩn
Mức độ bao quát yêu cầu (3 hạng mục)COV-01 Tất cả các trang và thao tác được yêu cầu trong prompt có được triển khai hay không
COV-02 Tất cả dữ liệu, quyền và Workflow được yêu cầu trong prompt có được triển khai hay không
COV-03 Các năng lực cần thiết cho quy trình chính nhưng không được nêu riêng trong prompt có đầy đủ hay không
Mở rộng hợp lý (2 hạng mục)EXT-01 Các Field, quan hệ liên kết và quy tắc được chủ động bổ sung có cần thiết hay không
EXT-02 Các trang, thao tác và số liệu thống kê được chủ động bổ sung có phục vụ mục đích rõ ràng hay không
Kiểm soát phạm vi (2 hạng mục)SCOPE-01 Có tạo ra các chức năng và cấu hình trùng lặp hoặc không được sử dụng hay không
SCOPE-02 Có bổ sung mô-đun nghiệp vụ không liên quan đến phạm vi tác vụ hay không

Lớp 3: Hiệu quả của quá trình xây dựng (8 hạng mục)

Chiều đánh giáHạng mục đánh giá tiêu chuẩn
Thời gian đến kết quả khả dụng đầu tiên (1 hạng mục)EFF-FIRST-01 Thời gian cần thiết để đạt được kết quả khả dụng đầu tiên
Hiệu quả hội tụ (3 hạng mục)EFF-FINAL-01 Số vòng lặp cần thiết để đạt nghiệm thu cuối cùng
EFF-FINAL-02 Tổng thời gian cần thiết để đạt trạng thái cuối cùng
EFF-FINAL-03 Số Token tiêu thụ để đạt trạng thái cuối cùng
Can thiệp của con người (1 hạng mục)EFF-HUMAN-01 Số lần can thiệp của con người trong quá trình đánh giá
Khả năng tái lập (3 hạng mục)EFF-STABLE-01 Các lần chạy lặp lại cùng một tác vụ có cho kết quả nghiệm thu nhất quán hay không
EFF-STABLE-02 Bảng dữ liệu, quan hệ liên kết, vai trò và Workflow có nhất quán qua ba lần chạy hay không
EFF-STABLE-03 Biến động về số vòng lặp và thời gian có nằm trong tầm kiểm soát hay không

Bước tiếp theo