Giới thiệu
Jalapeño là ASIC inference do OpenAI phát triển cùng Broadcom. Thiết kế bắt đầu giữa năm 2024 và đi đến tape-out sau khoảng 16 tháng. SemiAnalysis cho biết đã đến lab của OpenAI, xem chip A0 chạy model thật và quan sát một phần benchmark InferenceX.
Đây là chip dành riêng cho LLM inference nhưng không khóa vào model nội bộ của OpenAI. Nhóm thử nghiệm đã chạy DeepSeek R1, Kimi K2.5 và GPT-OSS. OpenAI còn port Doom lên chip như một demo cho tính tổng quát của software stack.
Kết quả chính
Trong bài test được công bố, Jalapeño đạt hơn 700 token/giây/người dùng với DeepSeek R1 ở concurrency 1. SemiAnalysis đánh giá chip dẫn đầu về output throughput trên mỗi megawatt trong các cấu hình họ được xem, dù chưa dùng multi-token prediction, speculative decoding hoặc tách prefill và decode.
Điều quan trọng là giới hạn của phép so sánh:
- Toàn bộ số liệu do OpenAI cung cấp; SemiAnalysis quan sát các run tại lab nhưng không chạy full InferenceX suite.
- Chưa có AgentX, bộ test long-context và multi-turn mà SemiAnalysis dùng để phản ánh prefix cache, router và hành vi production.
- So với Blackwell là chưa cân bằng vì Jalapeño dùng HBM4 và gần thế hệ Rubin hơn.
- Jalapeño hiện mới là engineering sample. Production dự kiến ramp dần trong năm 2027, chủ yếu vào cuối năm.
Vì vậy, kết quả là tín hiệu kỹ thuật đáng chú ý, chưa phải benchmark độc lập hoàn chỉnh hay sản phẩm có thể mua hôm nay.
Kiến trúc và software stack
Bản B0 dùng compute die TSMC N3P, đạt 13,4 PFLOPs MXFP4 với TDP 700 W. Package dùng HBM4 với bandwidth 15,4 TB/s. OpenAI cho biết B0 cải thiện khoảng 25% performance-per-watt so với A0.
Khác với nhiều hệ thống chia phần cứng thành pool prefill và pool decode, Jalapeño dùng một fleet đồng nhất. Cách này hy sinh một phần hiệu quả lý thuyết tại một traffic ratio cố định để tránh hardware bị nhàn khi tỷ lệ input, cache hit, output hoặc latency target thay đổi. Nó cũng giữ KV cache gần nơi decode thay vì luôn chuyển state qua network.
Ở mức core, chip dùng out-of-order core, L1 cache và prefetching thay cho scratchpad được software quản lý hoàn toàn. Mục tiêu là giảm fixed latency ở batch nhỏ mà vẫn giữ hiệu quả ở throughput cao. Đổi lại, compiler và kernel phải tìm được prefetch schedule tốt cho từng shape.
OpenAI lập trình chip bằng Gluon, ngôn ngữ kernel xây trên Triton với abstraction layout cấp thấp. Nhiều kernel dài tới khoảng 3.000 dòng, có correctness check và sanitizer riêng. Bài viết cho biết Codex được dùng để tạo và tối ưu kernel cho model mới; pipeline đã đưa MLA kernel của DeepSeek lên chip mà không cần đội kernel can thiệp trực tiếp.
Ý nghĩa với Dev
Điểm đáng theo dõi không phải là “CUDA đã chết”, mà là tốc độ hardware/software co-design. Một model lab có thể viết kernel cấp thấp, kiểm tra correctness và lặp benchmark nhanh hơn chu kỳ compiler truyền thống. Nếu kết quả giữ được trên long-context, multi-turn và production traffic, custom ASIC sẽ gây áp lực lên cả GPU merchant lẫn software moat quanh chúng.
Hiện tại, dev không nên đổi kiến trúc phục vụ model dựa trên các số đo này. Hãy chờ AgentX hoặc benchmark độc lập, số liệu reliability khi rack vận hành dài ngày, production availability và pricing. Jalapeño chứng minh một hướng có thể hoạt động; năm 2027 mới cho biết nó có vận hành được ở quy mô lớn hay không.