Chuyển đến nội dung
tinAI
Quay lại

PyTorch Monarch chạy trên AMD ROCm

pytorch.org · Loại nguồn: công ty/blog 2026-07-25T20:07:14.804Z
Bản dịch tiếng Việt của tinAI · Từ Bringing PyTorch Monarch to AMD GPUs: Single-Controller Distributed Training on ROCm (pytorch.org) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Bringing PyTorch Monarch to AMD GPUs: Single-Controller Distributed Training on ROCm (pytorch.org)

Tác giả: PyTorch

Ngày đăng: Dịch ngày:

TL;DR

PyTorch Monarch đã được port sang AMD GPU qua ROCm, mang single-controller distributed training, actor runtime và fault recovery sang hệ AMD. Bản dịch tập trung vào kiến trúc, phần port CUDA/HIP/RCCL, và lý do các team training lớn nên quan tâm đến recovery thay vì chỉ benchmark throughput.

Ước tính đọc: 3 phút

Giới thiệu

PyTorch Monarch là runtime để điều phối distributed training từ một chương trình Python duy nhất. Bài viết này thông báo Monarch đã được port sang AMD Instinct GPU qua ROCm, thay vì chỉ sống trong hệ CUDA.

Bối cảnh khá rõ: training LLM nhiều tỷ parameter trên hàng trăm hoặc hàng nghìn GPU không chỉ cần scale tốt, mà còn cần chịu lỗi tốt. Một GPU lỗi bộ nhớ, network partition hoặc node crash có thể làm phí nhiều ngày compute nếu job phải restart từ checkpoint.

Tính năng chính

Monarch kết hợp vài khối hạ tầng:

Điểm quan trọng là fault tolerance được tách khỏi parallelism strategy. Khi một phần training replica hỏng, lỗi có thể được xử lý ở tầng gần nhất thay vì làm toàn bộ cluster dừng lại.

Port sang ROCm

Nhóm PyTorch mô tả ba phần chính khi đưa Monarch sang AMD GPU:

Một chi tiết kỹ thuật hay là họ không fork Rust code theo hai nhánh CUDA/ROCm. Sau khi bindgen sinh ra type HIP, các module compatibility re-export symbol HIP dưới tên CUDA như cudaError_t hoặc cudaSetDevice. Nhờ vậy phần còn lại của Rust runtime ít phải biết đang chạy trên NVIDIA hay AMD.

Nhóm tác giả nói toàn bộ 1.171 test pass và các thay đổi đã được upstream qua PR #2393 và #2891 trong repository Monarch.

Fault recovery hoạt động ra sao

Case study trong bài kết hợp Monarch, TorchFT và TorchTitan:

Kịch bản ví dụ có bốn replica group, mỗi replica có tám GPU process. Khi một GPU process trong replica 0 crash, supervisor của Monarch bắt lỗi và restart replica đó tại chỗ. Các replica còn lại vẫn tiếp tục training. Sau đó Lighthouse chọn một replica khỏe làm donor để chuyển checkpoint ngang hàng, rồi quorum mới được tạo và training tiếp tục.

Ý nghĩa với Dev

Nếu bạn chỉ train nhỏ trên một node, Monarch có thể hơi xa nhu cầu hằng ngày. Nhưng với team đang tính chuyện AMD GPU, neocloud, hoặc cluster nhiều node, bài này là tín hiệu tốt: hệ sinh thái ROCm đang có thêm runtime production-grade thay vì chỉ có benchmark model.

Điểm nên kiểm tra khi áp dụng:

Nói ngắn gọn: scaling training chưa đủ; job càng lớn thì recovery càng là feature chính.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Bringing PyTorch Monarch to AMD GPUs: Single-Controller Distributed Training on ROCm (pytorch.org) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: web 1