Alibaba Mở Mã Open Code Review: Soát Mã Bằng AI, Tốn 1/9 Token Của Claude Code Theo Số Hãng

Công cụ soát mã bằng AI mà Alibaba nói đã dùng nội bộ hơn hai năm đang đứng đầu GitHub Trending với hơn 34.000 sao. Kiến trúc lai: đường ống tất định chọn tệp, gom nhóm và khớp luật (NPE, an toàn luồng, XSS, SQL injection), rồi mới giao cho tác tử LLM. Bộ đo AACR-Bench do chính Alibaba dựng cho thấy

Một công cụ soát mã đứng đầu GitHub Trending ngày 17/9/2026 với hơn 3.000 sao trong một ngày. Nó không phải mô hình mới. Nó là thứ Alibaba nói đã chạy trong nội bộ hơn hai năm trước khi mở mã, và luận điểm bán hàng của nó không phải "thông minh hơn", mà là "ít báo động giả hơn và rẻ hơn chín lần". Cả hai con số đều do Alibaba đo. Bài này đọc kỹ chúng.

Nó là gì

Open Code Review (viết tắt trong tài liệu là OCR, dễ nhầm với nhận dạng ký tự quang học, nên bài này gọi đầy đủ) là một công cụ dòng lệnh: nó đọc phần thay đổi trong Git, gửi các tệp liên quan tới một mô hình ngôn ngữ có khả năng dùng công cụ, và trả về các bình luận soát mã có cấu trúc, gắn đúng dòng. Kho mã alibaba/open-code-review được tạo ngày 18/5/2026, giấy phép Apache 2.0, và tại thời điểm Locaith đọc ngày 18/9/2026 có 34.667 sao, 2.466 fork và 206 vấn đề đang mở. Phiên bản mới nhất là v1.12.5 phát hành ngày 17/9; từ 14/9 tới 17/9 có năm bản phát hành liên tiếp.

Điểm khác biệt Alibaba nhấn mạnh là kiến trúc "kỹ thuật tất định × tác tử". Phần tất định gồm: chọn và lọc tệp chính xác, gom các tệp liên quan thành nhóm để mô hình có ngữ cảnh, khớp luật chi tiết qua bộ mẫu cho các lỗi quen thuộc như lỗi con trỏ null, an toàn luồng, XSS và SQL injection, và các mô-đun định vị cùng phản tư bên ngoài để bình luận trúng dòng. Phần tác tử gồm lời nhắc được tinh chỉnh cho việc soát mã và bộ công cụ thu hẹp theo cách dùng thực tế. Ngoài chế độ soát diff, có lệnh ocr scan để rà toàn bộ tệp, chế độ uỷ quyền để Claude Code, Codex, Cursor, Kimi Code hay OpenCode tự chạy soát mã bằng mô hình của chúng, và tích hợp CI với GitHub Actions, GitLab CI, GitFlic và Gerrit.

Màn hình cấu hình nhà cung cấp mô hình của Open Code Review, liệt kê 13 lựa chọn gồm Alibaba DashScope, Anthropic Claude, Baidu Qianfan, DeepSeek, Kimi Moonshot, MiniMax, OpenAI, Tencent, Volcano Engine, Xiaomi MiMo và Z.AI
Màn hình chọn nhà cung cấp mô hình trong công cụ: 13 hãng có sẵn, cùng hai lựa chọn "Custom" và "Manual" cho điểm cuối tự cấu hình. Ảnh: kho mã alibaba/open-code-review trên GitHub.

Bộ đo do chính hãng dựng, và cách đọc nó

Alibaba công bố AACR-Bench: 50 kho mã nguồn mở, 200 pull request thật, 10 ngôn ngữ lập trình, 1.505 lỗi được đánh dấu bởi hơn 80 kỹ sư cao cấp. Bảng kết quả trong README so sánh cùng một mô hình khi chạy qua Open Code Review với khi chạy qua Claude Code hoặc Codex.

Mô hình Chạy qua F1 Chính xác Bao phủ Token TB / PR
Claude 4.6 OpusOpen Code Review25,10%33,90%20,00%385K
Qwen3.8-MaxOpen Code Review23,00%33,90%17,40%334K
GLM-5.2Open Code Review21,30%32,30%15,90%682K
GPT-5.5Open Code Review21,00%32,10%15,50%422K
Claude 4.8 OpusOpen Code Review17,90%37,80%11,70%352K
Claude 4.8 OpusClaude Code14,13%15,93%12,70%2.062K
Claude 4.6 OpusClaude Code11,57%7,23%28,90%5.664K
GPT-5.5Codex8,36%27,82%4,92%525K

Nguồn: bảng AACR-Bench trong README của kho alibaba/open-code-review, Locaith đọc 18/9/2026, trích 8 trong 14 dòng. Đây là số do Alibaba đo trên bộ đo do Alibaba dựng; chưa có đơn vị độc lập nào chạy lại. Phiên bản công cụ trong bảng là v1.3.1 và v1.8.7, cũ hơn bản đang phát hành.

Bảng xếp hạng AACR-Bench đầy đủ 14 dòng của Alibaba, so sánh F1, độ chính xác, độ bao phủ, thời gian và token trung bình giữa Open Code Review, Claude Code và Codex trên nhiều mô hình
Bảng AACR-Bench đầy đủ do Alibaba công bố. Tám dòng đầu là Open Code Review, năm dòng tiếp là Claude Code, dòng cuối là Codex. Ảnh: kho mã alibaba/open-code-review.

Ba điều cần rút ra từ bảng, và cả ba đều nằm ngoài dòng tiêu đề:

Các con số không kiểm chứng được

README mở đầu bằng năm con số: hơn 20.000 người dùng nội bộ, hơn 3 triệu tác vụ soát mã đã chạy, hơn 329.000 lượt tải npm trong 30 ngày, chi phí token 1/9 so với Claude Code trên 1.000 PR, và điểm F1 25,10% trên AACR-Bench. Ba con số đầu là Alibaba tự khai; Locaith không có cách kiểm chứng. Số kiểm chứng được là số trên GitHub đã nêu ở trên, và vị trí số một trên GitHub Trending ngày 17/9/2026 với 3.286 sao tăng trong ngày, theo ảnh chụp trang trending mà Locaith đọc.

Băng số liệu đầu README của Open Code Review: hơn 20.000 người dùng nội bộ, hơn 3 triệu tác vụ, hơn 329.000 lượt tải npm trong 30 ngày, chi phí token 1/9 so với Claude Code, và 25,10% F1 trên AACR-Bench
Năm con số Alibaba đặt ở đầu README. Ba số bên trái là hãng tự khai và không kiểm chứng được từ bên ngoài. Ảnh: kho mã alibaba/open-code-review.

Điều đáng rút ra cho doanh nghiệp Việt Nam

Nguồn:

  • GitHub — alibaba/open-code-review — nguồn sơ cấp cho mô tả kiến trúc, bộ luật có sẵn, chế độ uỷ quyền, tích hợp CI, bảng AACR-Bench, năm con số ở đầu README, giấy phép Apache 2.0 và hai ảnh trong bài; Locaith đọc README ngày 18/9/2026
  • GitHub API — Dữ liệu kho alibaba/open-code-review — nguồn cho ngày tạo 18/5/2026, 34.667 sao, 2.466 fork, 206 vấn đề đang mở và trang chủ open-codereview.ai; đọc 18/9/2026
  • GitHub API — Danh sách phát hành — nguồn cho v1.12.5 ngày 17/9/2026 và năm bản phát hành từ 14/9 tới 17/9
  • GitHub — GitHub Trending — Locaith đọc ngày 17/9/2026 (giờ Việt Nam 18/9), ghi nhận kho đứng đầu với 3.286 sao tăng trong ngày

Toàn bộ điểm AACR-Bench, con số người dùng nội bộ, tác vụ đã chạy, lượt tải npm và tỷ lệ token 1/9 là do Alibaba công bố, đo trên bộ đo do Alibaba dựng; chưa có đơn vị độc lập nào chạy lại tại thời điểm đăng, và Locaith chưa tự chạy công cụ. Số sao, fork, vấn đề mở và ngày tạo kho là dữ liệu GitHub tại thời điểm đọc và sẽ thay đổi. Phiên bản công cụ trong bảng đo (v1.3.1, v1.8.7) cũ hơn bản đang phát hành (v1.12.5). Nhận xét về cấu hình "Custom" cho mô hình tự vận hành là suy luận từ giao diện, chưa được Locaith kiểm thử. Phần khuyến nghị cuối bài là quan điểm riêng của Locaith. Ảnh bìa: cắt từ ảnh chụp màn hình cấu hình nhà cung cấp trong kho mã alibaba/open-code-review; ảnh trong bài: cùng kho mã. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 18/9/2026.

Messenger