Xin chào ! Nếu đây là lần đầu tiên bạn đến với diễn đàn, xin vui lòng danh ra một phút bấm vào đây để đăng kí và tham gia thảo luận cùng VnPro.
X
 
  • Filter
  • Time
  • Show
Clear All
new posts

  • Từ Data Center truyền thống đến AI Data Center: Điều gì đang thay đổi?

    Từ Data Center truyền thống đến AI Data Center: Điều gì đang thay đổi?


    Trong nhiều năm, Data Center được thiết kế chủ yếu để phục vụ ứng dụng doanh nghiệp như ERP, Email, Database hay các máy ảo VMware. Kiến trúc mạng khi đó tập trung vào lưu lượng North-South, tức dữ liệu đi từ người dùng vào máy chủ và ngược lại.

    Nhưng AI đã thay đổi hoàn toàn bức tranh này.

    Các mô hình AI hiện đại không còn chạy trên một vài máy chủ, mà trên hàng trăm hoặc hàng nghìn GPU phải trao đổi dữ liệu liên tục với nhau. Chính sự thay đổi của workload đã buộc Data Center phải tiến hóa sang một kiến trúc hoàn toàn mới.
    Hạ tầng truyền thống: Compute là trung tâm


    Ở phía bên trái của hình là kiến trúc Data Center phổ biến hiện nay.

    Các máy chủ thường sử dụng kết nối 10G hoặc 25G, uplink lên Leaf ở mức 25G hoặc 100G, còn Spine phổ biến là 100G hoặc 400G. Mô hình Leaf-Spine vẫn đáp ứng tốt cho phần lớn ứng dụng doanh nghiệp, nơi lưu lượng chủ yếu đi giữa người dùng và máy chủ.

    Đây là kiến trúc tối ưu cho virtualization và các ứng dụng giao dịch, nhưng chưa được thiết kế cho AI training quy mô lớn.
    AI làm thay đổi yêu cầu của mạng


    Ở phía bên phải là kiến trúc AI Optimized Data Center.

    Điểm khác biệt lớn nhất không nằm ở số lượng switch, mà ở loại lưu lượng mà mạng phải xử lý.

    Trong AI cluster, GPU liên tục đồng bộ gradient, weight và tensor với nhau. Lưu lượng East-West giữa các GPU chiếm phần lớn băng thông và diễn ra đồng thời trên hàng trăm hoặc hàng nghìn thiết bị.

    Nếu mạng xuất hiện độ trễ cao, jitter hoặc mất gói, hiệu năng của cả cụm GPU sẽ giảm đáng kể. Một GPU phải chờ GPU khác hoàn thành tác vụ đồng bộ là đủ để làm chậm toàn bộ quá trình huấn luyện.
    Xuất hiện mạng Backend dành riêng cho AI


    Đó là lý do các AI Data Center hiện đại thường tách thành hai miền mạng.

    Front-End Network vẫn đảm nhiệm lưu lượng North-South giữa người dùng, ứng dụng và dịch vụ.

    Trong khi đó, Back-End Network được xây dựng riêng cho GPU Cluster, Storage và các máy chủ AI. Đây là nơi diễn ra gần như toàn bộ lưu lượng East-West và thường được thiết kế như một fabric độc lập để đảm bảo độ trễ thấp, băng thông cao và tránh ảnh hưởng từ các ứng dụng khác.
    Tốc độ mạng cũng thay đổi


    Một thay đổi rất dễ nhận thấy là tốc độ kết nối.

    Trong Data Center truyền thống, kết nối 10G hoặc 25G từng được xem là đủ cho máy chủ.

    Với AI Infrastructure, các GPU server hiện nay thường sử dụng 100G, 200G, 400G, thậm chí 800G Ethernet để đáp ứng khối lượng dữ liệu khổng lồ giữa các GPU và hệ thống lưu trữ.

    Điều này cũng kéo theo sự phát triển của các công nghệ như RoCEv2, RDMA, PFC, ECN và các kiến trúc Leaf-Spine non-blocking nhằm khai thác tối đa băng thông mà không làm tăng độ trễ.
    GPU Cluster trở thành trung tâm của Data Center


    Nếu trước đây Data Center xoay quanh các cụm máy chủ CPU, thì trong AI Data Center, GPU Cluster mới là thành phần quan trọng nhất.

    Xung quanh cụm GPU là các Storage Cluster tốc độ cao, các NIC chuyên dụng và mạng Backend hiệu năng cực lớn. Mọi thành phần đều được tối ưu để dữ liệu di chuyển nhanh nhất giữa GPU và Storage, thay vì chỉ phục vụ truy cập của người dùng.
    Góc nhìn của kỹ sư hạ tầng


    Điều đáng chú ý là AI không tạo ra một kiến trúc mạng hoàn toàn mới. Những nền tảng quen thuộc như Leaf-Spine, VXLAN EVPN, Ethernet vẫn được sử dụng.

    Sự khác biệt nằm ở cách tối ưu hóa hạ tầng. Thay vì chỉ kết nối máy chủ với người dùng, mạng giờ đây phải phục vụ việc đồng bộ dữ liệu giữa hàng nghìn GPU với yêu cầu độ trễ cực thấp, băng thông cực lớn và gần như không chấp nhận mất gói.

    Có thể nói, AI đang đưa mạng máy tính từ vai trò kết nối hệ thống lên vai trò quyết định hiệu năng của toàn bộ cụm GPU. Trong AI Factory hiện đại, giá trị của một fabric không còn được đo bằng số lượng switch hay tốc độ cổng mạng, mà bằng khả năng giữ cho hàng nghìn GPU hoạt động đồng bộ với hiệu suất cao nhất.
    Attached Files
    Đặng Quang Minh, CCIE#11897 (Enterprise Infrastructure, Wireless, Automation, AI), CCSI#31417

    Email : dangquangminh@vnpro.org
    https://www.facebook.com/groups/vietprofessional/
Working...
X