Prime Agent: Harness Mã Nguồn Mở Cho Agent Tự Cải Tiến, Đạt 95,5% ARC-AGI-3
Prime Intellect phát hành mã nguồn mở Prime Agent theo giấy phép MIT — một lớp harness bọc quanh mô hình có sẵn, cho phép agent tự sửa chính bộ khung điều khiển của mình khi đang chạy. Nhóm tác giả báo cáo 95,5% RHAE Best@1 trên ARC-AGI-3 khi dùng Opus 5, nhỉnh hơn mốc chuyên gia người 95,4% mà ARC
Ngày 5/8/2026, Prime Intellect phát hành mã nguồn mở Prime Agent theo giấy phép MIT. Đây không phải một mô hình mới mà là một harness — lớp khung điều khiển bọc quanh mô hình có sẵn — với một đặc điểm khác thường: agent có thể tự sửa chính bộ khung điều khiển của mình ngay khi đang chạy. Nhóm tác giả báo cáo 95,5% RHAE Best@1 trên ARC-AGI-3 với Opus 5. Con số đó đáng chú ý, và cũng đáng được đọc kỹ hơn phần lớn các bản tin đã đọc nó.
1. Harness Là Gì Và Vì Sao Nó Đang Trở Thành Chiến Trường Mới
Khi nói tới năng lực của một agent, phản xạ thông thường là hỏi "dùng mô hình nào". Nhưng trong thực tế vận hành, phần lớn khác biệt về chất lượng lại nằm ở harness: lớp phần mềm quyết định mô hình nhìn thấy gì trong context, công cụ được mô tả ra sao, kết quả được đưa trở lại thế nào, và điều gì còn sót lại sau khi phiên làm việc kết thúc. Cùng một mô hình, hai harness khác nhau cho ra hai trải nghiệm khác hẳn nhau.
Prime Agent tấn công đúng vào tầng này, với hai khái niệm mà nhóm tác giả — Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller cùng nhóm Prime Intellect — đặt làm trụ cột.
2. RLM: Coi Context Là Biến, Sub-Agent Là Lời Gọi Hàm
Recursive Language Model (RLM) là ý tưởng thứ nhất. Thay vì mô tả công cụ bằng schema JSON rồi để mô hình chọn, Prime Agent đặt mô hình vào một kernel IPython bền bỉ. Công cụ, skill và sub-agent đều tồn tại dưới dạng code Python gọi được. Context không còn là một khối văn bản trôi đi, mà là biến có thể gán, cắt, truyền vào hàm.
Theo mô tả của nhóm tác giả, cách này cho phép mô hình "viết ra các chương trình mô hình ngôn ngữ như những hành động tác động lên chính context của nó". Hệ quả thực tế đáng kể: khi cần xử lý một khối lượng lớn tài liệu, agent không phải nhồi tất cả vào context rồi chờ bị nén, mà có thể viết vòng lặp gọi sub-agent xử lý từng phần và chỉ giữ lại kết quả tổng hợp.
Vì sao điều này quan trọng với bài toán context
Cách xử lý context phổ biến hiện nay là nén (compaction): khi context đầy, tóm tắt lại phần cũ. Nhược điểm là tóm tắt luôn mất mát, và mất cái gì thì không kiểm soát được. Cách của RLM là không để context đầy ngay từ đầu — dữ liệu nằm trong biến Python, agent chỉ kéo vào context đúng phần cần nhìn. Đây là khác biệt về kiến trúc, không phải về mức độ tối ưu.
3. Continual Harness: Agent Sửa Được Chính Mình
Ý tưởng thứ hai là Continual Harness. Toàn bộ trạng thái của harness — prompt bổ sung, skill, bộ nhớ, cấu hình sub-agent — được phơi ra dưới dạng các thành phần CRUD mà agent đọc và ghi được trong lúc đang chạy. Cơ chế cụ thể là lệnh /refine: agent ghi những cập nhật nhỏ, có dẫn chứng, vào phần trạng thái bổ sung.
Cần nói rõ một điều mà nhiều bản tin diễn đạt sai: đây không phải là mô hình tự huấn luyện lại chính nó. Trọng số không hề thay đổi. Cái được cập nhật là bộ nhớ và quy trình nằm ngoài mô hình. Nhóm tác giả cũng giữ hai rào chắn đáng ghi nhận: system prompt gốc được bảo toàn, và mọi thay đổi có thể khôi phục lại bằng snapshot.
Phân biệt này quan trọng vì nó quyết định rủi ro. Một hệ tự sửa trọng số là bài toán an toàn rất khác. Một hệ tự sửa ghi chú của mình, có bản gốc bất biến và có nút hoàn tác, thì gần với "agent biết ghi sổ tay" hơn là với viễn cảnh AI tự tiến hoá.
4. Con Số ARC-AGI-3 — Đọc Cho Đúng
ARC-AGI-3 là bộ đánh giá suy luận tương tác: agent phải khám phá môi trường lạ, tự rút ra mục tiêu, xây mô hình thế giới và học liên tục — không có hướng dẫn bằng ngôn ngữ. Nó đo hiệu quả thu nhận kỹ năng chứ không đo đáp án cuối. Kết quả nhóm tác giả công bố:
| Chỉ số | Giá trị | Ghi chú |
|---|---|---|
| RHAE Best@1 (tốt nhất) | 95,5% | Với Opus 5 |
| Ba lần chạy | 95,0 / 95,2 / 95,5 | Biên độ dao động 0,5 điểm |
| Mốc chuyên gia người | 95,4% | Theo số ARC công bố, do Prime Intellect dẫn lại |
| Best@3 | 99,97% | Hoàn thành 183/183 màn |
Đây là chỗ cần tỉnh táo. Tiêu đề "AI vượt chuyên gia người" dựa trên khoảng cách 0,1 điểm phần trăm giữa 95,5% và 95,4%. Nhưng chính dữ liệu của nhóm tác giả cho thấy ba lần chạy dao động từ 95,0 đến 95,5 — biên độ dao động giữa các lần chạy (0,5 điểm) lớn gấp năm lần khoảng cách tới mốc so sánh. Hai trong ba lần chạy nằm dưới mốc 95,4%.
Cách phát biểu chính xác là: Prime Agent với Opus 5 đạt mức ngang chuyên gia người trên ARC-AGI-3, với lần chạy tốt nhất nhỉnh hơn một chút. Đó vẫn là kết quả rất mạnh cho một harness mã nguồn mở. Nó chỉ không phải là "vượt qua" theo nghĩa thống kê.
Ba lưu ý về nguồn số liệu
- Toàn bộ số liệu trên là do nhà phát hành công bố (vendor-published), lấy từ blog chính thức của Prime Intellect.
- Tại thời điểm viết bài, chúng tôi không xác nhận được kết quả này trên bảng xếp hạng công khai của ARC Prize.
- Chưa có bên thứ ba lặp lại độc lập. Với một harness mã nguồn mở thì việc lặp lại là khả thi — chỉ là chưa xảy ra.
Một điểm nhóm tác giả tự nêu và rất đáng ghi nhận về mặt trung thực: "hiện chưa có mô hình nào được huấn luyện xoay quanh Prime Agent hoặc bộ tính năng cốt lõi của nó". Tức là kết quả đạt được hoàn toàn nhờ lớp khung, với mô hình chưa hề được tối ưu cho nó.
5. Mức Độ Quan Tâm Của Cộng Đồng
Tại thời điểm chúng tôi kiểm tra, PrimeIntellect-ai/prime-agent đứng đầu bảng GitHub Trending theo ngày với hơn 2.300 sao thu được trong một ngày, trên tổng số hơn 11.000 sao và hơn 1.100 fork. Repo có khoảng 4.480 commit trên nhánh chính — không phải một dự án vừa dựng lên để công bố.
Đáng chú ý là bối cảnh xung quanh: cùng ngày, bảng trending còn có google/skills và addyosmani/agent-skills — cả hai đều xoay quanh việc đóng gói năng lực cho agent dưới dạng skill tái sử dụng. Điểm chung là một chuyển dịch đáng ghi nhận: trọng tâm cạnh tranh đang dịch từ mô hình sang lớp khung vận hành quanh mô hình.
6. Doanh Nghiệp Việt Nam Nên Nhìn Gì Từ Đây
Prime Agent cài được bằng một lệnh và giấy phép MIT cho phép dùng thương mại. Nhưng trước khi đưa vào môi trường thật, có vài điều nên cân nhắc:
- Agent chạy code thật với quyền thật. Kernel Python bền bỉ là nguồn sức mạnh của kiến trúc này, đồng thời là bề mặt rủi ro. Nên chạy trong container hoặc máy ảo tách biệt, cấp quyền tối thiểu, và không đưa thẳng vào hệ thống có dữ liệu khách hàng khi chưa đánh giá kỹ.
- Cách cài đặt được khuyến nghị là tải script từ internet rồi chạy thẳng qua shell. Đây là cách phổ biến trong giới mã nguồn mở nhưng không phù hợp với quy trình bảo mật của nhiều doanh nghiệp. Nên tải file về, đọc, rồi mới chạy.
- Chi phí vận hành nằm ở mô hình, không ở harness. Harness miễn phí, nhưng kết quả 95,5% kia đạt được với Opus 5 và với một agent chạy dài, gọi nhiều sub-agent. Cần dự toán token trước khi triển khai rộng — Prime Agent có sẵn cơ chế đặt hạn mức theo lượt, theo token và theo thời gian, nên dùng ngay từ đầu.
- Giá trị thực tế lớn nhất có thể không phải là điểm benchmark, mà là tính liên tục: agent giữ được ngữ cảnh và mẫu thao tác qua nhiều phiên. Với các quy trình nội bộ lặp đi lặp lại — đối soát chứng từ, xử lý hồ sơ theo mẫu, tổng hợp báo cáo định kỳ — đây mới là phần đáng thử nghiệm.
Nếu tổ chức của bạn đang ở giai đoạn sớm hơn — cần chuẩn hoá văn bản hành chính theo Nghị định 30/2020/NĐ-CP hoặc dựng nhanh bộ tài liệu trình bày — thì một công cụ chuyên biệt như Compose Word hay Design Studio của Locaith sẽ cho kết quả nhanh hơn nhiều so với việc tự dựng hạ tầng agent. Prime Agent là công cụ cho đội kỹ thuật muốn tự xây, không phải giải pháp cắm vào là chạy.
Nguồn tham khảo:
- Prime Intellect — Prime Agent: A self-improving RLM agent (ngày 5/8/2026 — nguồn gốc của toàn bộ số liệu ARC-AGI-3, mô tả RLM và Continual Harness, cùng lưu ý "chưa có mô hình nào được huấn luyện quanh Prime Agent")
- GitHub — PrimeIntellect-ai/prime-agent (giấy phép MIT, số sao và fork, lệnh /refine, cơ chế snapshot, hạn mức theo lượt/token/thời gian)
- GitHub Trending — Trending repositories (daily) (vị trí số 1 và số sao thu được trong ngày)
- ARC Prize — ARC-AGI-3 (định nghĩa và mục tiêu của bộ đánh giá)
Lưu ý về số liệu: mọi con số benchmark trong bài là do Prime Intellect tự công bố, chưa được bên thứ ba lặp lại độc lập tại thời điểm viết. Chúng tôi không xác nhận được kết quả 95,5% trên bảng xếp hạng công khai của ARC Prize — trang leaderboard chúng tôi truy cập không hiển thị dữ liệu xếp hạng. Mốc chuyên gia người 95,4% là số Prime Intellect dẫn lại từ ARC, chúng tôi chưa đối chiếu được với công bố gốc của ARC. Các nguồn tin thứ cấp ghi ngày phát hành là 6/8/2026, trong khi blog gốc ghi 5/8/2026; chúng tôi lấy theo nguồn gốc. Số sao GitHub được ghi nhận tại thời điểm truy cập ngày 10/8/2026 và thay đổi liên tục. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 10/8/2026.