Chuyển đến nội dung
tinAI
Quay lại

AMD mua Taalas: inference nhanh hơn bằng cách khóa model vào silicon

theregister.com · Loại nguồn: web 2026-08-07T20:07:25.598Z
Bản dịch tiếng Việt của tinAI · Từ AMD acquires AI chip startup Taalas to boost inference performance by etching models into silicon (theregister.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: AMD acquires AI chip startup Taalas to boost inference performance by etching models into silicon (theregister.com)

Tác giả: The Register

Ngày đăng: Dịch ngày:

TL;DR

AMD mua Taalas để theo đuổi hướng inference cực chuyên biệt: đưa trọng số model vào silicon. Cách này có thể làm token rẻ và nhanh hơn rất nhiều, nhưng chỉ hợp khi model đủ ổn định để đáng bị khóa vào phần cứng.

Ước tính đọc: 3 phút

Tóm tắt

AMD đã mua Taalas, một startup làm accelerator inference bằng cách đưa trọng số model trực tiếp vào silicon. Ý tưởng này hứa hẹn giảm mạnh chi phí và độ trễ token generation, nhưng đổi lại khách hàng phải chấp nhận một phần cứng gắn chặt với model cụ thể.

Dev nên quan tâm vì đây là tín hiệu rằng hạ tầng AI đang tách thành hai lớp: GPU linh hoạt cho phần prompt/prefill và accelerator chuyên biệt cho phần sinh token lặp lại.

Taalas làm gì khác GPU

Cách triển khai thông thường của LLM phụ thuộc nhiều vào HBM để giữ và nạp trọng số model. Taalas đi theo hướng khác: trọng số được mã hóa vào chip, biến accelerator thành một dạng mạch tích hợp theo model. Bài viết gọi đây là MSIC, tức model-specific integrated circuit.

Chip thử nghiệm HC1 của Taalas được sản xuất trên tiến trình TSMC 6nm và từng được công bố với benchmark Llama 3.1 8B đạt 16.960 token/giây. Theo bài gốc, con số đó nhanh hơn GPU Nvidia 48 lần và accelerator Cerebras 8,5 lần tại thời điểm công bố. Llama 3.1 8B đã cũ, nên benchmark này nên được đọc như bằng chứng concept, không phải bằng chứng production cho model frontier hiện tại.

Kiến trúc mà AMD có thể muốn

Bài viết cho rằng AMD có thể ghép rack Instinct/Helios với accelerator dựa trên công nghệ Taalas. Trong mô hình đó, GPU xử lý phần prompt processing nhiều compute, còn chip Taalas xử lý token generation. Đây là phần lặp lại rất đắt khi agent hoặc code assistant cần nghĩ lâu hơn, gọi tool nhiều hơn, hoặc sinh nhiều bước trung gian.

Taalas nói thế hệ HC2 nhắm tới 20 tỷ tham số mỗi chip. Với pipeline parallelism, model lớn hơn có thể được chia qua nhiều accelerator; bài viết ước tính 50 chip có thể phục vụ một model nghìn tỷ tham số.

Cái giá của việc đóng model vào vật lý

Nhược điểm lớn nhất cũng nằm ngay trong thiết kế: khi chip đã ra, bạn bị khóa vào model đó. Thay đổi nhỏ kiểu adapter có thể còn phù hợp, nhưng thay đổi model lớn sẽ cần re-spin. Taalas nói việc cập nhật không phải làm lại toàn bộ chip mà chỉ đổi hai lớp metal, rẻ và nhanh hơn làm lại từ đầu, nhưng đó vẫn là một chu kỳ phần cứng.

Vì model mới xuất hiện liên tục, loại accelerator này có vẻ hợp hơn với model provider, inference provider, hoặc khách hàng có workload rất lớn và tương đối ổn định. Với team ứng dụng bình thường, bài học không phải là mua chip mới, mà là thiết kế sản phẩm với giả định chi phí token sẽ còn thay đổi mạnh.

Ý nghĩa với dev


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ AMD acquires AI chip startup Taalas to boost inference performance by etching models into silicon (theregister.com) · Loại nguồn: web và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 1 loại nguồn (2 bài). Loại nguồn: công ty/blog 2