Tóm tắt
Anthropic công bố rằng một phiên bản research chưa phát hành của Claude đã cải thiện một kết quả liên quan tới Riemann hypothesis. Claude không chứng minh giả thuyết Riemann. Kết quả cụ thể là nâng cận dưới lâu năm cho tỉ lệ zeros của hàm Riemann zeta nằm trên critical line từ 41,6% lên 67,2%.
Theo Anthropic, Claude dựa trên nhiều công trình trước đó của các nhà toán học, gồm Baluyot, Goldston, Suriajaya, Turnage-Butterbaugh và Bombieri. Claude tạo paper, một ghi chú informal cho chuyên gia và một Lean formalization. Hai nhà toán học tại Anthropic kiểm tra kết quả, và hai chuyên gia bên ngoài cũng được nhờ xem xét trong thời gian ngắn.
Phát hiện chính
Kết quả toán học nằm ở việc kết hợp các kỹ thuật đã có để vượt qua cận dưới 41,6%. Bài của Anthropic mô tả cách Claude xây một không gian hàm phù hợp, dùng quadratic form, xét các subspace positive-definite và negative-definite sinh từ zeros nằm trên hoặc ngoài critical line, rồi dùng thông tin moment để đưa ra bất đẳng thức về rank.
Phần này vẫn là toán chuyên sâu. Với đa số developer, điều quan trọng hơn là Anthropic không trình bày nó như một output không kiểm chứng. Bài có link tới paper đầy đủ, informal note, phần giải thích cách Claude đi tới kết quả và Lean formalization.
Workflow của Claude
Anthropic nói Claude ban đầu thử 650 ý tưởng nhưng không thành công. Sau đó, trong khoảng một ngày rưỡi, Claude phối hợp khoảng 60 subagents, chạy 2.400 shell commands và viết hàng trăm Python scripts. Các subagents kiểm tra số với known zeta zeros, review lẫn nhau, tìm counterexample, tải 54 paper từ arXiv để xem kết quả đã có ai làm trước chưa, rồi tự đề nghị cần nhà toán học người thật xác nhận.
Chi tiết này đáng chú ý hơn câu chuyện prompt. Nó cho thấy kết quả research-agent không đến từ một câu hỏi hay duy nhất, mà từ search rộng, tooling, verification và human review. Nếu bỏ các lớp kiểm chứng đó, câu chuyện rất dễ trượt thành marketing.
Ý nghĩa với Dev
Dev nên quan tâm vì workflow này giống hình hài tương lai của agent làm việc dài hơi: nhiều worker, filesystem, shell, script, external corpus, formal checker và reviewer người thật. Đây là cùng họ vấn đề với coding agent trong repo lớn, chỉ khác domain.
Bài cũng là lời nhắc về giới hạn. Anthropic nói kỹ thuật này có lẽ không dẫn tới chứng minh Riemann hypothesis. Vì vậy, cách đọc hợp lý là: model có thể mở rộng tầm với của chuyên gia khi được đặt trong quy trình kiểm chứng nghiêm túc; nó chưa thay thế chuyên gia, và càng không miễn bước validation.