Tóm tắt
Bài giảng của Terence Tao tại ICM 2026 đặt câu hỏi: nếu AI sớm làm được một phần đáng kể các tác vụ toán học cấp nghiên cứu, cộng đồng toán học nên thay đổi mục tiêu và chuẩn mực như thế nào? Tao không cố chứng minh AI chắc chắn sẽ thay nhà toán học; ông dùng giả thuyết đó như một điều kiện để phân tích phần khó hơn: verification, giá trị nghiên cứu, đào tạo thế hệ mới, và nguy cơ tối ưu sai metric.
Điểm đáng đọc nhất là phần First Proof. Batch thứ hai, chạy ngày 28/05/2026 dưới điều kiện kiểm soát, có 10 bài toán nghiên cứu mới; 7 bài được ít nhất một team giải ở chất lượng có thể xuất bản, với chi phí compute khoảng 10-1000 USD mỗi bài.
Phát hiện chính
First Proof đang biến “AI làm toán” thành eval nghiêm túc hơn
First Proof được mô tả như một đánh giá độc lập cho frontier AI models và harnesses. Mỗi batch gồm 10 bài toán nghiên cứu mới ở nhiều lĩnh vực, kết quả được chuyên gia phản biện cả về tính đúng lẫn cách trình bày.
Điều này quan trọng vì toán học không chỉ cần câu trả lời nghe hợp lý. Một proof sai nhưng tự tin có thể làm tốn thời gian hơn một model yếu mà biết dừng. Eval có referee độc lập giúp tách “model nói hay” khỏi “model tạo ra kết quả có thể dùng trong nghiên cứu”.
Tao tạm giả định AI sẽ làm được nhiều tác vụ nghiên cứu
Tao gọi đây là “Working Hypothesis”: trong tương lai gần, AI tools sẽ có thể làm một phần hợp lý các tác vụ toán học cấp nghiên cứu, với mức thành công, chất lượng, giám sát và chi phí hợp lý. Ông nhấn mạnh đây là phân tích có điều kiện, không phải tuyên bố chắc chắn.
Cách đặt vấn đề này đáng học cho người làm AI product. Thay vì cãi mãi xem capability đã đủ hay chưa, ta có thể hỏi: nếu capability đó đúng một phần, hệ thống kiểm chứng, incentive và workflow hiện tại sẽ gãy ở đâu?
Goodhart’s law là rủi ro lớn khi proof generation rẻ đi
Khi một metric trở thành mục tiêu, nó ngừng là metric tốt. Với AI, rủi ro này nặng hơn vì generative models không tự có nền tảng đúng/sai như hệ thống formal, còn các công ty AI có incentive khoe capability.
Nếu mục tiêu bị giản lược thành “giải càng nhiều bài mở càng tốt”, hệ thống có thể sinh ra nhiều lời giải chưa kiểm chứng, làm nghẽn reviewer, hoặc đẩy cộng đồng chạy theo bài toán dễ benchmark thay vì xây lý thuyết bền vững.
Toán học không chỉ là giải bài
Tao liệt kê nhiều mục tiêu của nghiên cứu toán học: giải vấn đề mở, phát triển theory, hiểu thế giới, xây cộng đồng, đào tạo thế hệ kế tiếp, đóng góp vào tri thức chung, và tạo ra các công trình có giá trị thẩm mỹ. Trước đây các mục tiêu này thường đi cùng nhau; AI có thể làm chúng lệch nhau.
Ví dụ, một hệ thống AI giỏi giải bài có thể tăng số lượng solution nhưng không nhất thiết giúp đào tạo nhà toán học trẻ, xây taste nghiên cứu, hay tạo theory mới. Nếu chỉ tối ưu output, ta có thể thắng dashboard nhưng thua nghề.
Ý nghĩa với Dev
Dev đang build agent nên nhìn bài này như một warning label cho eval. “Task completed” không đủ; cần có tầng verification độc lập, tiêu chí chất lượng rõ, và cách đo chi phí thật. Với coding agents, tương đương là test, review, reproducible run logs, và khả năng giải thích trade-off chứ không chỉ PR xanh một lần.
Bài giảng cũng nhắc rằng automation làm rẻ phần generation sẽ chuyển bottleneck sang triage và judgment. Khi code, design doc, migration plan hay proof đều dễ sinh hơn, kỹ năng quý hơn là biết cái gì đáng sinh, cái gì cần bỏ, và cái gì phải kiểm chứng bằng hệ thống khác.