Needle 2: Mô Hình Nền 14MB Gọi Công Cụ Ngay Trên Điện Thoại

Một mô hình 45 triệu tham số gói trong tệp nhị phân 14MB, chạy trọn một phiên làm việc trong khoảng 28MB RAM, và làm đúng một việc: nhận yêu cầu bằng ngôn ngữ tự nhiên rồi trả về lời gọi hàm dưới dạng JSON. Needle 2 của Cactus Compute leo bảng GitHub Trending hôm nay với giấy phép MIT. Điểm cần biết

Một mô hình 45 triệu tham số gói trong tệp nhị phân 14MB, chạy trọn một phiên làm việc trong khoảng 28MB RAM, và làm đúng một việc: nhận yêu cầu bằng ngôn ngữ tự nhiên rồi trả về lời gọi hàm dưới dạng JSON. Needle 2 của Cactus Compute đang leo bảng GitHub Trending hôm nay với giấy phép MIT.

1. Nó Là Cái Gì

Needle 2 không phải một mô hình trò chuyện thu nhỏ. Nó được huấn luyện cho ba việc hẹp: gọi công cụ, điều khiển thiết bị, và trích xuất dữ liệu có cấu trúc. Cơ chế mô tả trong tài liệu là văn bản vào, JSON ra — bạn khai báo các hàm sẵn có bằng cách gắn decorator, mô hình đọc yêu cầu của người dùng rồi quyết định gọi hàm nào với tham số gì.

Thiết bị mục tiêu mà nhóm phát triển nêu ra: điện thoại, thiết bị đeo, thiết bị nhà thông minh và robot. Đây là nhóm phần cứng mà một mô hình vài tỷ tham số không thể chạy thoải mái, còn gọi API đám mây thì vướng độ trễ, chi phí và kết nối.

2. Các Con Số Kỹ Thuật

Thông số Giá trị Ghi chú
Số tham số 45 triệu Nhỏ hơn khoảng 6 lần so với FunctionGemma 270M
Kích thước tệp 14MB Một tệp nhị phân duy nhất
RAM mỗi phiên ~28MB Gần như không tăng theo độ dài hội thoại
Lượng tử hoá CQ2 — 2 bit Định dạng riêng của Cactus Quants
Cửa sổ ngữ cảnh 256 token trượt Phần khai báo công cụ được ghim làm KV sink
Giấy phép MIT Theo thông tin kho mã trên GitHub

Chi tiết đáng chú ý nhất về mặt kỹ thuật là cửa sổ trượt 256 token với công cụ được ghim làm KV sink. Nói đơn giản: phần khai báo các hàm luôn nằm trong bộ nhớ, còn phần hội thoại thì trượt đi. Đó là lý do mức RAM giữ ổn định quanh 28MB thay vì phình ra theo thời gian — đánh đổi lại là mô hình không nhớ được hội thoại dài.

3. Điều README Không Có: Bảng Điểm

Tuyên bố hiệu năng chưa có số đi kèm

Nhóm phát triển viết rằng Needle 2 có thắng có thua khi so với FunctionGemma 270M, LFM2.5 230MApple FM, trong khi nhỏ hơn 5 đến 70 lần và dùng 2 bit thay vì f16 như các mô hình kia. Nhưng khi đọc README, chúng tôi không tìm thấy bảng điểm cụ thể nào cho tuyên bố đó — không tên bộ đánh giá, không con số, không mô tả điều kiện chạy. Với một dự án đang được chú ý, đây là khoảng trống thật sự. Hãy đọc câu tuyên bố kia như một định hướng của tác giả, không phải một kết quả đã đo.

Cần nói thêm về so sánh "2 bit so với f16". Việc một mô hình lượng tử hoá 2 bit bám được các mô hình f16 lớn hơn nhiều lần là điều đáng chú ý nếu đúng — nhưng lượng tử hoá cực thấp thường làm chất lượng giảm không đều: rất ổn ở các tác vụ khuôn mẫu, và tệ đi rõ rệt ở các trường hợp biên. Với bài toán gọi công cụ, các trường hợp biên chính là chỗ hệ thống hỏng.

Biểu đồ đường của Cactus Compute: trục ngang là tổng số tham số (0 đến 3 tỷ), trục dọc là độ chính xác Mobile-Actions (%). Needle 2 ở mức 45 triệu tham số, lượng tử hoá CQ2 2 bit, đạt khoảng 64%; LFM2.5 230M (f16) khoảng 69%; FunctionGemma 270M (f16) khoảng 64%; Apple FM chạy trên thiết bị với 3 tỷ tham số chỉ khoảng 57%.
Bằng chứng hiệu năng duy nhất mà README đưa ra cho tuyên bố “có thắng có thua”: Needle 2 ở 45 triệu tham số và 2 bit bám sát FunctionGemma 270M chạy f16, và vượt Apple FM 3 tỷ tham số trên chỉ số Mobile-Actions. Đây là một biểu đồ tổng hợp một chỉ số do chính nhóm phát triển tự công bố — vẫn không kèm bảng điểm chi tiết hay mô tả điều kiện chạy, nên hãy tự đo lại trước khi đưa vào sản phẩm. Ảnh: Cactus Compute (GitHub).

4. Vì Sao Mô Hình Tí Hon Đáng Chú Ý Đúng Lúc Này

Needle 2 xuất hiện đúng tuần Hugging Face công bố báo cáo State of Open Models: Summer 2026 (ngày 14/8/2026), trong đó có một phát hiện đi ngược hoàn toàn với cảm giác thường thấy trên mặt báo: trong số các mô hình có khai báo số tham số, nhóm dưới 1 tỷ tham số chiếm 83% tổng lượt tải mọi thời, còn nhóm trên 100 tỷ chỉ chiếm 1%.

Nói cách khác, phần lớn hoạt động tải mô hình thực tế không diễn ra ở tầng mô hình khổng lồ mà báo chí hay nhắc. Nó diễn ra ở tầng mô hình nhỏ, chạy cục bộ, làm một việc hẹp. Needle 2 là một ví dụ khá cực đoan của xu hướng đó — và mức tăng sao trên GitHub cho thấy nhu cầu này có thật.

5. Ai Nên Thử, Ai Không

6. Ý Nghĩa Với Doanh Nghiệp Việt Nam

Nếu nhu cầu của tổ chức bạn nằm ở phía văn bản chứ không phải thiết bị — chuẩn hoá văn bản hành chính theo Nghị định 30/2020/NĐ-CP, hay dựng nhanh bộ CV, brochure, slide — thì các công cụ chuyên biệt như Compose WordDesign Studio của Locaith cho kết quả ngay mà không đòi hỏi bạn tự tích hợp và tự đo một mô hình mã nguồn mở.

Nguồn tham khảo:

  • GitHub — cactus-compute/needle (45 triệu tham số, tệp nhị phân 14MB, khoảng 28MB RAM mỗi phiên, lượng tử hoá CQ2 2 bit, cửa sổ trượt 256 token với công cụ ghim làm KV sink, gọi công cụ và trích xuất dữ liệu có cấu trúc, thiết bị mục tiêu gồm điện thoại và thiết bị đeo và nhà thông minh và robot, giấy phép MIT, lệnh cài pip install cactus-needle cùng extras gpu và metal, tuyên bố so sánh với FunctionGemma 270M và LFM2.5 230M và Apple FM)
  • GitHub Trending — Bảng xếp hạng kho mã theo ngày (vị trí của cactus-compute/needle và mức tăng sao trong ngày 16/8/2026)
  • Hugging Face — State of Open Models: Summer 2026 (báo cáo ngày 14/8/2026, nhóm dưới 1 tỷ tham số chiếm 83% tổng lượt tải mọi thời, nhóm trên 100 tỷ chiếm 1%)

Lưu ý về số liệu: mọi thông số kỹ thuật của Needle 2 trong bài là do nhóm phát triển công bố trong kho mã, chúng tôi chưa tự đo lại. Tuyên bố ngang ngửa FunctionGemma 270M, LFM2.5 230M và Apple FM không kèm bảng điểm nào trong README tại thời điểm chúng tôi đọc — hãy coi đó là định hướng của tác giả chứ không phải kết quả đã đo. Số sao GitHub là ảnh chụp bảng trending ngày 16/8/2026 và thay đổi liên tục. Không có dữ liệu công bố nào về năng lực tiếng Việt của mô hình này. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 16/8/2026.

Messenger