DGX OS คืออะไร?
DGX OS คือระบบปฏิบัติการที่สร้างขึ้นโดยเฉพาะของ NVIDIA สำหรับโครงสร้างพื้นฐาน AI บน Ubuntu Linux มันก้าวไปไกลกว่าการแจกจ่ายแบบมาตรฐานโดยการผสานรวมซอฟต์แวร์ AI ที่ได้รับการปรับให้เหมาะสมที่สุด คุณลักษณะด้านความปลอดภัยระดับองค์กร และเครื่องมือการจัดการคลัสเตอร์ไว้ในแพลตฟอร์มเดียวที่เหนียวแน่น เดิมทีมีให้บริการเฉพาะบนฮาร์ดแวร์ DGX ของ NVIDIA เท่านั้น DGX OS ได้ขยายการเข้าถึงและตอนนี้สนับสนุนระบบพันธมิตรที่เลือก ซึ่งสะท้อนถึงความทะเยอทะยานของ NVIDIA ที่จะกลายเป็นแพลตฟอร์มเริ่มต้นสำหรับการประมวลผล AI ในทุกขนาด
สำหรับวิศวกร AI DGX OS แก้ปัญหาที่เกิดขึ้นอย่างต่อเนื่อง นั่นคือช่องว่างระหว่างการติดตั้งระบบปฏิบัติการและการมีสภาพแวดล้อมที่พร้อมสำหรับการผลิตสำหรับการฝึกอบรมและการอนุมาน บน Ubuntu มาตรฐาน การกำหนดค่าไดรเวอร์ CUDA, cuDNN, รันไทม์ของคอนเทนเนอร์, โครงสร้างเครือข่าย และพื้นที่เก็บข้อมูลอาจใช้เวลาหลายวันในด้านวิศวกรรมและทำให้เกิดปัญหาความเข้ากันได้เล็กน้อย DGX OS ขจัดความขัดแย้งนี้โดยสิ้นเชิง
ชุดซอฟต์แวร์ AI ที่กำหนดค่าไว้ล่วงหน้า
หัวใจสำคัญของ DGX OS คือสแต็กซอฟต์แวร์ AI ที่ได้รับการกำหนดค่าล่วงหน้าและตรวจสอบความถูกต้องแล้ว ทุกส่วนประกอบได้รับการทดสอบร่วมกันและรับประกันว่าจะทำงานได้อย่างมีประสิทธิภาพสูงสุดบนฮาร์ดแวร์ที่รองรับ
ชุดเครื่องมือ CUDA: DGX OS มาพร้อมกับ CUDA ที่เสถียรล่าสุด ซึ่งได้รับการกำหนดค่าอย่างสมบูรณ์ด้วยตัวแปรสภาพแวดล้อม เส้นทางไลบรารี และชุดเครื่องมือคอมไพเลอร์ เวอร์ชันของไดรเวอร์จะถูกจับคู่กับเคอร์เนลและทดสอบกับรุ่น GPU เฉพาะในระบบ ไม่มีการติดตั้งไดรเวอร์ด้วยตนเอง ไม่มีการแก้ไขข้อบกพร่องเวอร์ชันไม่ตรงกัน และไม่มีลิงก์สัญลักษณ์ที่เสียหาย
cuDNN: ไลบรารี CUDA Deep Neural Network ได้รับการติดตั้งไว้ล่วงหน้าและปรับแต่งสำหรับสถาปัตยกรรม GPU ที่มีอยู่ในระบบ DGX OS มีโปรไฟล์การปรับแต่งอัตโนมัติของ cuDNN สำหรับสถาปัตยกรรมเครือข่ายทั่วไป ซึ่งหมายความว่าการดำเนินการ Convolution หรือ Attention ครั้งแรกของคุณจะทำงานด้วยความเร็วที่เกือบจะเหมาะสมที่สุดโดยไม่ต้องมีการทดลองอุ่นเครื่อง
TensorRT: กลไกการเพิ่มประสิทธิภาพการอนุมานของ NVIDIA มาพร้อมกับปลั๊กอินที่สร้างไว้ล่วงหน้าสำหรับสถาปัตยกรรมโมเดลยอดนิยม DGX OS กำหนดค่า TensorRT ให้ใช้หน่วยความจำ GPU ที่มีอยู่อย่างมีประสิทธิภาพ ช่วยให้สามารถอนุมาน INT8 และ FP16 ได้ทันทีด้วยเครื่องมือสอบเทียบที่พร้อมใช้งาน
ปปช.: NVIDIA Collective Communications Library มีความสำคัญอย่างยิ่งต่อการฝึกฝนแบบหลาย GPU และแบบหลายโหนด DGX OS กำหนดค่า NCCL ด้วยการตั้งค่าที่รับรู้ถึงโทโพโลยีที่ตรงกับแฟบริค NVLink, NVSwitch และ InfiniBand ของระบบ บนระบบ DGX H100 ที่มี GPU แปดตัวเชื่อมต่อผ่าน NVSwitch นั้น NCCL จะได้รับแบนด์วิดท์ที่ใกล้เคียงตามทฤษฎีสูงสุดสำหรับการดำเนินการแบบลดขนาดทั้งหมดโดยไม่ต้องปรับแต่งด้วยตนเอง
คอนเทนเนอร์รันไทม์และ NGC
DGX OS ใช้คอนเทนเนอร์เป็นกลไกการใช้งานหลักสำหรับปริมาณงาน AI NVIDIA Container Toolkit ได้รับการติดตั้งไว้ล่วงหน้า ช่วยให้ Docker และรันไทม์ที่เข้ากันได้กับ OCI อื่นๆ สามารถเข้าถึง GPU ได้อย่างโปร่งใส เมื่อคุณเรียกใช้คอนเทนเนอร์ อุปกรณ์ GPU ไดรเวอร์ และไลบรารีจะถูกต่อเชื่อมภายในเนมสเปซของคอนเทนเนอร์โดยอัตโนมัติ
ระบบนี้ได้รับการบูรณาการอย่างแนบแน่นกับ NVIDIA NGC ซึ่งเป็นแค็ตตาล็อกของคอนเทนเนอร์ที่ปรับให้เหมาะสม GPU สำหรับเฟรมเวิร์ก AI หลักทุกรายการ คอนเทนเนอร์ NGC สำหรับ PyTorch, TensorFlow, JAX, RAPIDS และเครื่องมืออื่นๆ อีกหลายสิบรายการได้รับการทดสอบทุกเดือนกับ DGX OS และเผยแพร่พร้อมเกณฑ์มาตรฐานประสิทธิภาพ การดึงและเรียกใช้คอนเทนเนอร์ NGC บน DGX OS เป็นคำสั่งเดียว:
docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3
คอนเทนเนอร์นี้ประกอบด้วย PyTorch ที่คอมไพล์ด้วยเวอร์ชัน CUDA และ cuDNN ที่เหมาะสมที่สุดสำหรับระบบโฮสต์ พร้อมด้วย Apex สำหรับการฝึกแบบผสมความแม่นยำ Transformer Engine สำหรับการคำนวณความสนใจอย่างมีประสิทธิภาพ และยูทิลิตีการฝึกอบรมแบบกระจายที่กำหนดค่าไว้ล่วงหน้า
ตัวจัดการคำสั่งฐานสำหรับการจัดกลุ่มคลัสเตอร์
สำหรับองค์กรที่ใช้ระบบ DGX หลายระบบ DGX OS จะทำงานร่วมกับ Base Command Manager (เดิมคือ Bright Cluster Manager) เลเยอร์การประสานนี้จัดให้มีการกำหนดเวลางานผ่าน Slurm หรือ Kubernetes การจัดสรรทรัพยากรแบบหลายโหนด การจัดการผู้ใช้และกลุ่ม และการตรวจสอบสภาพทั่วทั้งคลัสเตอร์
Base Command Manager จัดการงานที่ซับซ้อนในการประสานงานงานการฝึกอบรมแบบหลายโหนด เมื่อคุณส่งงานการฝึกอบรมที่ต้องใช้ 32 GPU บนโหนด DGX สี่โหนด ผู้จัดการจะจัดสรรทรัพยากร กำหนดค่าแฟบริคเครือข่าย เรียกใช้กระบวนการในแต่ละโหนด และตรวจสอบความล้มเหลว หาก GPU พบข้อผิดพลาด ผู้จัดการสามารถตรวจสอบสถานะการฝึกและรีสตาร์ทงานด้วยฮาร์ดแวร์ที่แข็งแรง
สำหรับทีมที่ชอบ Kubernetes นั้น DGX OS รองรับ NVIDIA GPU Operator และ Network Operator ซึ่งเปิดเผย GPU และการเชื่อมต่อระหว่างกันความเร็วสูงเป็นทรัพยากร Kubernetes ช่วยให้ทีมแพลตฟอร์มสามารถจัดเตรียมโครงสร้างพื้นฐาน AI แบบบริการตนเองผ่าน Kubernetes API มาตรฐาน ในขณะที่ DGX OS จัดการกับความซับซ้อนเฉพาะของฮาร์ดแวร์ที่อยู่ด้านล่าง
คุณสมบัติด้านความปลอดภัย
ระบบ AI ระดับองค์กรจัดการข้อมูลที่ละเอียดอ่อนและทรัพยากรการประมวลผลราคาแพง ทำให้การรักษาความปลอดภัยเป็นข้อกังวลอันดับหนึ่งใน DGX OS
บูตอย่างปลอดภัย: DGX OS ตรวจสอบความสมบูรณ์ของห่วงโซ่การบูตตั้งแต่เฟิร์มแวร์ผ่านเคอร์เนลไปจนถึงพื้นที่ผู้ใช้ ทุกส่วนประกอบได้รับการเซ็นชื่อแบบเข้ารหัส เพื่อป้องกันไม่ให้โหลดเคอร์เนลหรือรูทคิทที่ถูกดัดแปลง สิ่งนี้มีความสำคัญอย่างยิ่งในสภาพแวดล้อมที่ใช้ร่วมกันซึ่งหลายทีมเข้าถึงฮาร์ดแวร์เดียวกัน
พื้นที่เก็บข้อมูลที่เข้ารหัส: การเข้ารหัสทั้งดิสก์พร้อมใช้งานทันทีตั้งแต่แกะกล่อง ปกป้องข้อมูลที่เหลือบนทั้งไดรฟ์ OS และพื้นที่จัดเก็บ NVMe ความเร็วสูง การจัดการคีย์ทำงานร่วมกับระบบองค์กร เช่น HashiCorp Vault และโมดูลความปลอดภัยของฮาร์ดแวร์
การแยกเครือข่าย: DGX OS รองรับนโยบายเครือข่ายแบบละเอียดที่แยกงานการฝึกอบรมออกจากกันและจากการรับส่งข้อมูลการจัดการ การรับส่งข้อมูล RDMA โดยตรง GPU จะไหลผ่านพาร์ติชัน InfiniBand เฉพาะ ช่วยป้องกันข้อมูลรั่วไหลระหว่างผู้เช่าบนคลัสเตอร์ที่ใช้ร่วมกัน
การบันทึกการตรวจสอบ: การดำเนินการด้านการดูแลระบบทั้งหมด การจัดสรร GPU และการเปิดตัวคอนเทนเนอร์จะถูกบันทึกไว้ในเส้นทางการตรวจสอบที่ป้องกันการงัดแงะ บันทึกเหล่านี้ผสานรวมกับแพลตฟอร์ม SIEM มาตรฐานสำหรับการตรวจสอบการปฏิบัติตามข้อกำหนด
การปรับแต่งประสิทธิภาพนอกกรอบ
DGX OS มีการเพิ่มประสิทธิภาพหลายร้อยรายการ ซึ่งผู้ดูแลระบบที่เชี่ยวชาญจะใช้เวลาหลายสัปดาห์ในการดำเนินการด้วยตนเอง เคอร์เนลได้รับการกำหนดค่าด้วยการตั้งค่าตัวควบคุม CPU ที่เหมาะสมที่สุด การจัดสรรหน่วยความจำ NUMA-aware และพารามิเตอร์สแต็กเครือข่ายที่ได้รับการปรับแต่ง โหมดคงอยู่ GPU ถูกเปิดใช้งานตามค่าเริ่มต้น ซึ่งช่วยลดเวลาแฝงในการเริ่มต้นที่รบกวนเวิร์กโฟลว์การพัฒนาบน Linux มาตรฐาน หน้าขนาดใหญ่ได้รับการจัดสรรไว้ล่วงหน้าสำหรับการแมปหน่วยความจำ GPU IRQ affinity ถูกตั้งค่าให้ลดโอเวอร์เฮด CPU ในระหว่างการถ่ายโอนข้อมูล
ผลลัพธ์สามารถวัดได้ การเปรียบเทียบเกณฑ์มาตรฐานแสดงให้เห็นอย่างสม่ำเสมอว่า DGX OS ให้ปริมาณงานการฝึกอบรมที่สูงกว่าห้าถึงสิบห้าเปอร์เซ็นต์เมื่อเทียบกับฮาร์ดแวร์ตัวเดียวกันที่ใช้งาน Ubuntu พร้อมไดรเวอร์ที่ติดตั้งด้วยตนเอง ความแตกต่างที่ประกอบขึ้นจากการฝึกอบรมหลายวันทำให้ประหยัดเวลาและต้นทุนได้อย่างมาก
ใครต้องการ DGX OS กับ Ubuntu มาตรฐาน?
DGX OS ไม่ใช่สำหรับทุกคน และการทำความเข้าใจว่าเมื่อใดจะเพิ่มมูลค่าเป็นสิ่งสำคัญ หากคุณเป็นนักวิจัยเดี่ยวที่มีการทดลอง GPU เพียงครั้งเดียวจากโน้ตบุ๊ก Jupyter Ubuntu มาตรฐานพร้อมชุดเครื่องมือ CUDA ที่ติดตั้งด้วยตนเองก็เพียงพอแล้ว โอเวอร์เฮดของฟีเจอร์ระดับองค์กรของ DGX OS จะเพิ่มความซับซ้อนโดยไม่เกิดประโยชน์
DGX OS จะน่าสนใจเมื่อคุณมี GPU หรือโหนดหลายรายการ เมื่อผู้ใช้หลายคนแชร์ฮาร์ดแวร์ เมื่อคุณต้องการสภาพแวดล้อมที่ทำซ้ำได้ทั่วทั้งการพัฒนาและการใช้งานจริง หรือเมื่อข้อกำหนดการปฏิบัติตามข้อกำหนดกำหนดคุณลักษณะด้านความปลอดภัย เช่น Secure Boot และการบันทึกการตรวจสอบ ในสถานการณ์เหล่านี้ เวลาที่ประหยัดได้ในการตั้งค่า การลดความเบี่ยงเบนของการกำหนดค่า และความอุ่นใจจากชุดซอฟต์แวร์ที่ผ่านการตรวจสอบแล้ว ถือเป็นการลงทุนที่สมเหตุสมผล
DGX OS บน Lenovo ThinkStation PGX
ในการขยายระบบนิเวศ DGX อย่างมีนัยสำคัญ NVIDIA ร่วมมือกับ Lenovo เพื่อนำ DGX OS มาสู่ ThinkStation PGX ซึ่งเป็นระบบระดับเวิร์กสเตชันที่ออกแบบมาเพื่อการพัฒนา AI ThinkStation PGX จับคู่ NVIDIA GPU กับการออกแบบเวิร์กสเตชัน การจัดการระบายความร้อน และโครงสร้างพื้นฐานการสนับสนุนของ Lenovo ในขณะที่ DGX OS มอบประสบการณ์ซอฟต์แวร์ที่ก่อนหน้านี้มีเฉพาะในฮาร์ดแวร์แบรนด์ NVIDIA เท่านั้น
ความร่วมมือครั้งนี้มีความสำคัญเนื่องจากนำความสามารถ AI ขององค์กรมาสู่ฟอร์มแฟคเตอร์ที่วางไว้ใต้โต๊ะได้ ทีมที่ต้องการซอฟต์แวร์ระดับ DGX แต่ไม่สามารถจัดวางแร็คศูนย์ข้อมูลได้ ขณะนี้สามารถติดตั้งระบบ ThinkStation PGX ในสภาพแวดล้อมสำนักงานที่มีสแต็กที่ได้รับการตรวจสอบเหมือนกันซึ่งทำงานบนระบบ DGX ในศูนย์ข้อมูล
การตั้งค่าและขั้นตอนแรก
การเริ่มต้นใช้งาน DGX OS ขึ้นอยู่กับฮาร์ดแวร์ของคุณ บนระบบ NVIDIA DGX ระบบปฏิบัติการจะถูกติดตั้งไว้ล่วงหน้า บนฮาร์ดแวร์ของคู่ค้าที่รองรับ เช่น ThinkStation PGX คุณจะติดตั้ง DGX OS จากอิมเมจ USB ที่สามารถบู๊ตได้ซึ่งให้บริการผ่านพอร์ทัลองค์กรของ NVIDIA
หลังการติดตั้ง ขั้นตอนแรกคือการลงทะเบียนระบบกับเซิร์ฟเวอร์ลิขสิทธิ์ของ NVIDIA เพื่อเปิดใช้งานการสนับสนุนระดับองค์กรและการเข้าถึง NGC ถัดไป ตรวจสอบสแต็ก GPU โดยการเรียกใช้ชุดการตรวจสอบความถูกต้องในตัว:
nvidia-smidgxos-validate --full
This runs a comprehensive check of drivers, libraries, interconnects, and storage. Once validation passes, pull your first NGC container and run a benchmark to confirm everything is performing as expected. From there, you can configure user accounts, set up Slurm or Kubernetes for job scheduling, and begin onboarding your AI workloads onto a platform that was built specifically to run them.