Xin chào ! Nếu đây là lần đầu tiên bạn đến với diễn đàn, xin vui lòng danh ra một phút bấm vào đây để đăng kí và tham gia thảo luận cùng VnPro.
X
 
  • Filter
  • Time
  • Show
Clear All
new posts

  • X-Fabric và mạng Back-end cho GPU trong Cisco UCS X-Series

    Các X-Fabric Module (XFM) cung cấp kết nối cho lưu lượng East-West bên trong chassis, đặc biệt là kết nối giữa Compute Node và GPU nằm trong các PCIe Node thông qua các PCIe lane.

    Mỗi Compute Node có một kết nối PCIe point-to-point trực tiếp tới các GPU bên ngoài, với băng thông tối đa 512 Gbps.

    Tuy nhiên, bài toán sẽ khác khi GPU của một node — dù GPU nằm bên trong Compute Node hay nằm trong PCIe Node — cần giao tiếp với GPU thuộc một node khác trong cùng chassis. Đây chính là trường hợp thường gặp trong các tác vụ Distributed AI/ML Training.

    Khi đó, theo kiến trúc thông thường, traffic sẽ đi qua:

    GPU → IFM → Fabric Interconnect → IFM → GPU của node khác

    Kết nối này cung cấp 100 Gbps, và mỗi Compute Node có thể đạt tối đa 200 Gbps khi sử dụng đồng thời hai upstream fabric Fabric A và Fabric B. 200 Gbps vẫn chưa đủ cho AI Training?


    Đối với các ứng dụng doanh nghiệp truyền thống, mức băng thông này đã rất lớn.

    Nhưng AI/ML Training là workload cực kỳ data-intensive. Khi nhiều GPU cùng huấn luyện một mô hình, chúng phải liên tục trao đổi và đồng bộ lượng dữ liệu rất lớn thông qua các phép toán như:

    AllReduce, AllGather, ReduceScatter và All-to-All.

    Vì vậy, mạng AI hiện nay đang chuyển lên các tốc độ:

    200G → 400G → 800G

    Để đáp ứng nhu cầu này, chassis UCS X-Series có thể được trang bị một hệ thống mạng chuyên biệt, về bản chất là một Dedicated Back-end Network dành cho giao tiếp GPU-to-GPU. Dedicated Back-end Network hoạt động thế nào?


    Trong kiến trúc này, X-Fabric Module sử dụng PCIe Gen5 Switch kết hợp với các SuperNIC Adapter.

    Các XFM còn có external ports, cho phép kết nối trực tiếp ra AI Fabric 200G/400G.

    Nhờ đó, traffic GPU-to-GPU không nhất thiết phải đi qua Fabric Interconnect truyền thống:

    GPU → X-Fabric/SuperNIC → AI Back-end Fabric → X-Fabric/SuperNIC → GPU

    Đây chính là mạng Inter-GPU hay Back-end AI Fabric mà chúng ta đã tìm hiểu trong các bài trước.

    Mục tiêu của nó không phải phục vụ user traffic thông thường mà tối ưu cho việc đồng bộ dữ liệu tốc độ cực cao giữa các GPU. Front-end Fabric và Back-end Fabric khác nhau thế nào?


    Có thể nhớ đơn giản:

    Front-end Fabric phục vụ traffic của ứng dụng, user, VM, Kubernetes, management, storage và các dịch vụ doanh nghiệp thông thường.

    Back-end Fabric chủ yếu phục vụ GPU-to-GPU communication trong Distributed AI Training.

    Vì vậy Cisco cũng lưu ý rằng:
    Back-end Network thường chỉ thực sự cần thiết đối với các workload Training nặng. Nếu hệ thống chủ yếu chạy AI Inference, Unified Front-end Fabric thường đã đủ.

    Điều này rất quan trọng vì không phải cứ triển khai AI là doanh nghiệp phải đầu tư ngay một mạng GPU 400G/800G riêng biệt. UCS X-Series giờ cũng có thể xây dựng AI Cluster


    Theo cách truyền thống, khi xây dựng AI Cluster hiệu năng cao, doanh nghiệp thường sử dụng các rack server GPU như Cisco UCS C885A hoặc C845A.

    Với khả năng cung cấp Dedicated Back-end Network, Cisco UCS X-Series cũng có thể được sử dụng để xây dựng các AI Cluster cần mạng GPU chuyên dụng.

    Như vậy, UCS X-Series đang tiến từ một hệ thống modular compute truyền thống thành một nền tảng có thể đáp ứng cả Enterprise Workload lẫn Distributed AI Training. Điểm cần nhớ


    Có thể hình dung kiến trúc UCS X-Series cho AI thành hai "đường cao tốc":

    Front-end:
    GPU/Compute → IFM → Fabric Interconnect → LAN/Data Center

    AI Back-end:
    GPU → X-Fabric/SuperNIC → 200G/400G AI Fabric → GPU

    Front-end giúp server giao tiếp với thế giới bên ngoài, còn Back-end giúp các GPU nói chuyện cực nhanh với nhau.

    Đây chính là một trong những thay đổi quan trọng khi Data Center truyền thống tiến hóa thành AI Data Center: Compute mạnh hơn chưa đủ; GPU càng mạnh thì mạng kết nối giữa các GPU cũng phải nhanh tương ứng.
    Attached Files
    Đặng Quang Minh, CCIE#11897 (Enterprise Infrastructure, Wireless, Automation, AI), CCSI#31417

    Email : dangquangminh@vnpro.org
    https://www.facebook.com/groups/vietprofessional/
Working...
X