Chuyển đến nội dung
tinAI
Quay lại

Jalapeño của OpenAI: ASIC inference thắng benchmark sớm, còn production chờ 2027

newsletter.semianalysis.com · Loại nguồn: web 2026-08-25T20:08:06.753Z
Bản dịch tiếng Việt của tinAI · Từ OpenAI Jalapeño: Better Than Nvidia Blackwell (newsletter.semianalysis.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: OpenAI Jalapeño: Better Than Nvidia Blackwell (newsletter.semianalysis.com)

Tác giả: SemiAnalysis

Ngày đăng: Dịch ngày:

TL;DR

Jalapeño cho thấy custom ASIC của OpenAI có performance-per-watt rất mạnh trên một phần InferenceX và software stack lên model mới nhanh. Tuy vậy, số liệu do OpenAI cung cấp, chưa có AgentX hay full suite, còn production chỉ ramp dần trong năm 2027.

Ước tính đọc: 4 phút

Giới thiệu

Jalapeño là ASIC inference do OpenAI phát triển cùng Broadcom. Thiết kế bắt đầu giữa năm 2024 và đi đến tape-out sau khoảng 16 tháng. SemiAnalysis cho biết đã đến lab của OpenAI, xem chip A0 chạy model thật và quan sát một phần benchmark InferenceX.

Đây là chip dành riêng cho LLM inference nhưng không khóa vào model nội bộ của OpenAI. Nhóm thử nghiệm đã chạy DeepSeek R1, Kimi K2.5 và GPT-OSS. OpenAI còn port Doom lên chip như một demo cho tính tổng quát của software stack.

Kết quả chính

Trong bài test được công bố, Jalapeño đạt hơn 700 token/giây/người dùng với DeepSeek R1 ở concurrency 1. SemiAnalysis đánh giá chip dẫn đầu về output throughput trên mỗi megawatt trong các cấu hình họ được xem, dù chưa dùng multi-token prediction, speculative decoding hoặc tách prefill và decode.

Điều quan trọng là giới hạn của phép so sánh:

Vì vậy, kết quả là tín hiệu kỹ thuật đáng chú ý, chưa phải benchmark độc lập hoàn chỉnh hay sản phẩm có thể mua hôm nay.

Kiến trúc và software stack

Bản B0 dùng compute die TSMC N3P, đạt 13,4 PFLOPs MXFP4 với TDP 700 W. Package dùng HBM4 với bandwidth 15,4 TB/s. OpenAI cho biết B0 cải thiện khoảng 25% performance-per-watt so với A0.

Khác với nhiều hệ thống chia phần cứng thành pool prefill và pool decode, Jalapeño dùng một fleet đồng nhất. Cách này hy sinh một phần hiệu quả lý thuyết tại một traffic ratio cố định để tránh hardware bị nhàn khi tỷ lệ input, cache hit, output hoặc latency target thay đổi. Nó cũng giữ KV cache gần nơi decode thay vì luôn chuyển state qua network.

Ở mức core, chip dùng out-of-order core, L1 cache và prefetching thay cho scratchpad được software quản lý hoàn toàn. Mục tiêu là giảm fixed latency ở batch nhỏ mà vẫn giữ hiệu quả ở throughput cao. Đổi lại, compiler và kernel phải tìm được prefetch schedule tốt cho từng shape.

OpenAI lập trình chip bằng Gluon, ngôn ngữ kernel xây trên Triton với abstraction layout cấp thấp. Nhiều kernel dài tới khoảng 3.000 dòng, có correctness check và sanitizer riêng. Bài viết cho biết Codex được dùng để tạo và tối ưu kernel cho model mới; pipeline đã đưa MLA kernel của DeepSeek lên chip mà không cần đội kernel can thiệp trực tiếp.

Ý nghĩa với Dev

Điểm đáng theo dõi không phải là “CUDA đã chết”, mà là tốc độ hardware/software co-design. Một model lab có thể viết kernel cấp thấp, kiểm tra correctness và lặp benchmark nhanh hơn chu kỳ compiler truyền thống. Nếu kết quả giữ được trên long-context, multi-turn và production traffic, custom ASIC sẽ gây áp lực lên cả GPU merchant lẫn software moat quanh chúng.

Hiện tại, dev không nên đổi kiến trúc phục vụ model dựa trên các số đo này. Hãy chờ AgentX hoặc benchmark độc lập, số liệu reliability khi rack vận hành dài ngày, production availability và pricing. Jalapeño chứng minh một hướng có thể hoạt động; năm 2027 mới cho biết nó có vận hành được ở quy mô lớn hay không.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ OpenAI Jalapeño: Better Than Nvidia Blackwell (newsletter.semianalysis.com) · Loại nguồn: web và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: tài liệu 1 Loại nguồn: web 1