Xin chào ! Nếu đây là lần đầu tiên bạn đến với diễn đàn, xin vui lòng danh ra một phút bấm vào đây để đăng kí và tham gia thảo luận cùng VnPro.
X
 
  • Filter
  • Time
  • Show
Clear All
new posts

  • Ôn tập: Các thành phần của một AI Factory theo chuẩn Cisco và NVIDIA

    Sau nhiều bài viết về AI Infrastructure, AI Networking, AI Security và AI Stack, chúng ta có thể ghép tất cả các mảnh lại thành một bức tranh hoàn chỉnh về AI Factory.

    Hình dưới đây thể hiện kiến trúc tham chiếu của Cisco Secure AI Factory with NVIDIA. Đây không phải là một sản phẩm đơn lẻ, mà là sự kết hợp của nhiều lớp công nghệ để doanh nghiệp có thể xây dựng một hệ thống AI hoàn chỉnh, từ hạ tầng phần cứng đến bảo mật và vận hành.
    1. Cisco AI POD – Nền tảng của AI Factory


    Có thể xem Cisco AI POD là "nhà xưởng" của AI Factory.

    Bên trong AI POD bao gồm toàn bộ hạ tầng cần thiết để huấn luyện và vận hành AI.

    NVIDIA AI Enterprise


    Đây là bộ phần mềm AI chính thức của NVIDIA, bao gồm:
    • NeMo để xây dựng và tinh chỉnh LLM.
    • NIM để triển khai (serve) các mô hình AI dưới dạng microservice.
    • Blueprints là các kiến trúc tham chiếu và workflow mẫu giúp triển khai nhanh các ứng dụng AI.

    Ngoài ra còn có Run:ai, nền tảng quản lý và điều phối GPU, giúp nhiều nhóm hoặc nhiều workload cùng chia sẻ tài nguyên GPU một cách hiệu quả.
    2. Kubernetes Platform – Điều phối toàn bộ AI Workload


    Ngày nay gần như mọi AI Factory đều chạy trên Kubernetes.

    Cisco hỗ trợ nhiều lựa chọn như:
    • Red Hat OpenShift
    • Nutanix NKP
    • Kubernetes chuẩn (Upstream Kubernetes)

    Kubernetes chịu trách nhiệm:
    • Quản lý container AI.
    • Tự động mở rộng.
    • Tự động phục hồi.
    • Điều phối GPU.
    • Triển khai AI Agent.

    Có thể xem Kubernetes là "hệ điều hành" của AI Factory.
    3. Cisco AI Networking – Hệ thần kinh của AI Factory


    Nếu GPU là cơ bắp thì mạng chính là hệ thần kinh.

    Cisco AI Networking bao gồm:
    • Cisco Nexus Data Center Switching.
    • Nexus Dashboard.
    • Nexus HyperFabric.
    • Isovalent Enterprise Networking.

    Đây chính là AI Fabric mà chúng ta đã tìm hiểu ở các bài trước:
    • Spine-Leaf Architecture.
    • Non-Blocking Fabric.
    • Rail Design.
    • RoCEv2.
    • ECN.
    • PFC.
    • Dynamic Load Balancing.

    Nhiệm vụ của lớp này là đảm bảo hàng trăm hoặc hàng nghìn GPU có thể trao đổi dữ liệu với độ trễ cực thấp và tận dụng tối đa băng thông 400G hoặc 800G Ethernet.
    4. Cisco Compute – Sức mạnh tính toán


    Lớp Compute cung cấp năng lực xử lý cho AI.

    Cisco hỗ trợ nhiều nền tảng như:
    • NVIDIA HGX.
    • NVIDIA MGX.
    • RTX PRO.
    • UCS Server.

    Bên cạnh đó còn có:
    • NVIDIA BlueField DPU.
    • Cisco Intersight để quản lý tập trung toàn bộ máy chủ.

    Đây là nơi CPU, GPU và DPU cùng phối hợp để thực hiện các tác vụ AI.
    5. Partner Storage – Kho dữ liệu của AI


    Không có dữ liệu thì AI không thể hoạt động.

    Cisco tích hợp với nhiều hệ thống lưu trữ hàng đầu như:
    • NetApp.
    • Pure Storage.
    • VAST Data.
    • Hitachi Vantara.
    • Nutanix Unified Storage.

    Storage trong AI Factory lưu trữ:
    • Dataset.
    • Checkpoint.
    • Vector Database.
    • Embedding.
    • Model.
    • Log.

    Đây là nền tảng cung cấp dữ liệu tốc độ cao cho GPU trong quá trình huấn luyện và suy luận.
    AI Security – Bảo mật cho AI Factory


    AI Factory không chỉ cần mạnh mà còn phải an toàn.

    Cisco xây dựng nhiều lớp bảo mật khác nhau. Cisco AI Defense


    Đây là lớp bảo vệ dành riêng cho ứng dụng AI.

    Nó giúp phát hiện:
    • Prompt Injection.
    • Jailbreak.
    • Rò rỉ dữ liệu.
    • LLM Abuse.
    • AI Model Misuse.

    AI Defense tập trung bảo vệ chính mô hình AI và các ứng dụng AI.
    Cisco Hybrid Mesh Firewall


    Đây là kiến trúc firewall mà chúng ta vừa tìm hiểu.

    Firewall không còn nằm ở một vị trí cố định mà được phân tán trên:
    • Firewall.
    • Switch.
    • Kubernetes.
    • Workload.
    • DPU.

    Các thành phần quan trọng gồm:
    • Isovalent Runtime Security.
    • Hypershield.
    • Secure Firewall.

    Kiến trúc này đặc biệt phù hợp với AI Data Center, nơi lưu lượng East-West chiếm ưu thế.
    Splunk Enterprise Security


    Đây là nền tảng SIEM của Cisco.

    Splunk giúp:
    • Thu thập log.
    • Phát hiện tấn công.
    • Điều tra sự cố.
    • Tự động hóa phản ứng.

    Toàn bộ sự kiện bảo mật của AI Factory đều có thể được tập trung và phân tích tại đây.
    AI Observability – Quan sát toàn bộ AI Factory


    Một AI Factory có thể bao gồm:
    • Hàng trăm GPU.
    • Hàng nghìn container.
    • Nhiều cụm Kubernetes.
    • Hệ thống lưu trữ tốc độ cao.
    • AI Agent.
    • LLM.

    Nếu không có khả năng giám sát, việc vận hành sẽ rất khó khăn.

    Cisco sử dụng Splunk Observability để theo dõi:
    • GPU Utilization.
    • CPU.
    • Storage.
    • Network.
    • Kubernetes.
    • AI Service.
    • API.
    • LLM.
    • AI Infrastructure Monitoring.

    Nhờ đó, đội ngũ vận hành có thể nhanh chóng phát hiện điểm nghẽn, tối ưu hiệu năng và xử lý sự cố trước khi ảnh hưởng đến các ứng dụng AI.
    Nhìn tổng thể AI Factory


    Nếu ghép tất cả các bài đã học lại, chúng ta sẽ thấy một AI Factory hiện đại được xây dựng theo nhiều lớp:

    Lớp hạ tầng gồm máy chủ Cisco UCS với GPU NVIDIA, DPU BlueField, hệ thống lưu trữ tốc độ cao và mạng AI Fabric sử dụng Cisco Nexus.

    Lớp nền tảng bao gồm Kubernetes, NVIDIA AI Enterprise, NeMo, NIM và Run:ai để triển khai, điều phối và quản lý các workload AI.

    Lớp bảo mật kết hợp Cisco AI Defense, Hybrid Mesh Firewall, Hypershield và Splunk Enterprise Security nhằm bảo vệ từ hạ tầng đến ứng dụng AI.

    Lớp vận hành và quan sát sử dụng Splunk Observability cùng Cisco Intersight để giám sát GPU, mạng, Kubernetes và toàn bộ AI Infrastructure theo thời gian thực.

    Kết luận


    Một AI Factory không chỉ là việc mua vài máy chủ GPU để chạy mô hình AI. Theo kiến trúc tham chiếu của Cisco và NVIDIA, đây là sự kết hợp chặt chẽ giữa Compute, Networking, Storage, Kubernetes, AI Platform, Security và Observability. Mỗi thành phần đều có vai trò riêng nhưng được tích hợp thành một hệ thống thống nhất, giúp doanh nghiệp triển khai AI ở quy mô lớn một cách hiệu quả, an toàn và dễ mở rộng.

    Đây cũng là xu hướng chung của ngành công nghiệp AI hiện nay: AI không còn là một ứng dụng riêng lẻ, mà đã trở thành một hạ tầng (AI Infrastructure) và một "nhà máy" (AI Factory) có khả năng sản xuất, vận hành và bảo vệ các dịch vụ AI giống như cách Data Center truyền thống vận hành các ứng dụng CNTT.
    Attached Files
    Đặng Quang Minh, CCIE#11897 (Enterprise Infrastructure, Wireless, Automation, AI), CCSI#31417

    Email : dangquangminh@vnpro.org
    https://www.facebook.com/groups/vietprofessional/
Working...
X