Chuyển đến nội dung
tinAI
Quay lại

Transformer nhỏ đạt 44% ARC-1 với 67 xu

mvakde.github.io · Loại nguồn: công ty/blog 2026-09-01T20:07:23.529Z
Bản dịch tiếng Việt của tinAI · Từ 44% on ARC-AGI-1 in 67 cents (mvakde.github.io) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: 44% on ARC-AGI-1 in 67 cents (mvakde.github.io)

Tác giả: mvakde

Ngày đăng: Dịch ngày:

TL;DR

Một transformer nhỏ được train từ đầu trong 1,5 giờ trên RTX 5090 đạt 44% ARC-1 public eval và 7% ARC-2. Kết quả làm rõ vai trò của representation và sample efficiency, nhưng vẫn là hệ chuyên ARC chứ không phải bằng chứng về reasoning tổng quát.

Ước tính đọc: 5 phút

Tóm tắt

Tác giả huấn luyện một transformer nhỏ từ đầu trong khoảng 1,5 giờ trên RTX 5090 và đạt 44% trên ARC-1 public eval. Tổng chi phí compute được báo cáo là 67 xu; cùng hệ thống đạt 7% trên ARC-2. Mục tiêu của thử nghiệm không phải tạo LLM tổng quát mà là đo xem deep learning có thể học hiệu quả đến đâu với rất ít mẫu.

Kết quả đáng chú ý vì kiến trúc tương đối quen thuộc đạt điểm cao bằng cách biểu diễn grid tốt hơn và huấn luyện ngay ở test time. Nó không chứng minh một model nhỏ có năng lực tổng quát hơn frontier LLM.

Phương pháp

Mỗi cặp input-output của ARC được chuyển thành chuỗi token. Một autoregressive transformer nhỏ được train từ đầu trên các puzzle huấn luyện và phần input của puzzle đánh giá; nhãn output cần dự đoán vẫn bị ẩn.

Các thành phần chính gồm:

Tác giả bổ sung các task ARC-2 không trùng với ARC-1. Đây là điểm cần xử lý cẩn thận vì ARC-2 chứa 773 puzzle ARC-1; nếu không lọc phần lặp, model có thể rò dữ liệu và đạt điểm giả. Sau khi bỏ task trùng, tác giả nói cấu hình chỉ dùng ARC-1 và ConceptARC vẫn đạt khoảng 40%, nhưng cần gần gấp đôi compute.

Phát hiện chính

Ablation cho thấy phần lớn mức tăng đến từ cách biểu diễn:

Tác giả cũng nhận thấy test loss tệ hơn nhưng điểm ARC tốt hơn sau khi chuyển sang objective supervised. Đây là ví dụ cho thấy tối ưu validation loss trên tập nhỏ không nhất thiết tối ưu đúng hành vi cuối cùng.

Chi phí giảm nhờ ít augmentation hơn, NorMuon thay cho AdamW thuần, packed training và kernel attention phù hợp hơn. Tác giả cho rằng handwritten GPU kernel có thể giảm chi phí thêm, nhưng đó là hướng thử tiếp chứ chưa phải kết quả đã đo.

Tranh luận về cách đánh giá

Model nhìn thấy input của eval puzzle khi train ở test time nhưng không nhìn thấy output label bị ẩn. Tác giả gọi đây là transductive reasoning và cho rằng nó phù hợp với một benchmark meta-learning. Phê bình hợp lý hơn nằm ở phạm vi kết luận: hệ thống được thiết kế riêng cho ARC và score dùng public eval, nên không thể dùng nó để nói model có reasoning tổng quát hoặc đánh bại LLM trên nhiều loại tác vụ.

Con số 67 xu là lifetime compute cho lần train và inference được mô tả, không bao gồm giá mua GPU. Nó cũng được phân bổ trên toàn bộ bộ task chạy cùng nhau. Vì vậy, so sánh cost-per-task với hệ thống xử lý từng task riêng lẻ có thể gây hiểu nhầm.

Tác giả hiện chỉ so trực tiếp với các phương pháp test-time training tương tự như TRM, HRM và CompressARC. Cách thu hẹp đó hợp lý hơn so với đặt model chuyên ARC cạnh LLM đã pretrain với chi phí không được tính vào cùng trục.

Ý nghĩa với dev

Điểm thực dụng của dự án là code mở và vòng lặp thử nghiệm rẻ hơn:

Nếu muốn tái hiện, hãy bắt đầu từ repository của tác giả, khóa dataset và seed, xác nhận danh sách task trùng đã bị loại, rồi chạy cả ablation chứ không chỉ cấu hình tốt nhất. Giá trị của bài viết nằm ở một giả thuyết có thể kiểm tra về sample efficiency, không nằm ở câu nói một transformer nhỏ đã vượt qua nhiều LLM.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ 44% on ARC-AGI-1 in 67 cents (mvakde.github.io) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 1 loại nguồn (2 bài). Loại nguồn: web 2