แกะกล่อง Mac Studio M4 และใช้งาน LLM ตัวแรกของคุณ
การอ่านค่าจริงจาก Mactop บนการติดตั้ง M4 Max, Ollama ใหม่, Llama 3 ภายในเครื่อง และไปป์ไลน์ RAG ส่วนตัวในบ่ายวันหนึ่ง
เนื้อหาสั้นๆ ที่อ่านง่ายสำหรับการดำน้ำลึกในรูปแบบยาว สำหรับคำแนะนำแบบเต็ม ให้ข้ามไปที่ บทความยาว.
กล่องที่อยู่บนโต๊ะตอนนี้กลายเป็นอุปกรณ์ AI แล้ว
ฉันแกะกล่อง Mac Studio ใหม่พร้อมชิป M4 Max, หน่วยความจำรวม 128 GB, GPU คอร์ 40 คอร์, CPU คอร์ 16 คอร์ และ SSD ความจุ 2 TB ภายในช่วงบ่าย มีการเรียกใช้ Llama 3.1 8B ภายในเครื่องผ่าน Ollama โดยฝังเอกสารของฉันเอง และตอบคำถามเหล่านั้นผ่านไปป์ไลน์ RAG ขนาดเล็ก ไม่มีค่าบริการคลาวด์ ไม่มีคีย์ API ไม่มีข้อมูลออกจากห้อง
บล็อกนี้เป็นเวอร์ชันสั้น บทความฉบับเต็มจะอธิบายขั้นตอนการทำงานเดียวกันในเชิงลึก
แกะกล่องภายใน 60 วินาที
ชมการแกะกล่องขนาดสั้นบน YouTube: https://youtube.com/shorts/HUlUoHNsyNM
การแกะกล่อง Apple แบบคลาสสิก: กระดาษแข็งแบบมินิมอล, ตัวเครื่องอยู่ในช่องขึ้นรูป, สายไฟ กล่อง Mac Studio มีขนาดประมาณ 7.7 นิ้วเป็นสี่เหลี่ยมจัตุรัสและมีความหนาแน่น คุณรู้สึกถึงคุณภาพงานสร้างทันทีที่คุณหยิบมันขึ้นมา การตั้งค่ารวดเร็วอย่างแท้จริง - Apple ID, ภาษา, FileVault เสร็จสิ้น
การบูตครั้งแรก - การอ่านจริงจาก mactop
/img/mac-studio-mactop-firstboot.png เพื่อเปลี่ยนในภายหลังตัวเลขข้างต้นเป็นเพียงตัวเลขที่ยากเท่านั้นที่ฉันจะยกมาอ้างอิง พวกเขาเป็นความจริงภาคพื้นดินจาก mactop บนเครื่องของฉันที่เวลาทำงาน 37 นาที:
- M4 Max - 16 คอร์ (4 E + 12 P), 40 GPU คอร์ ที่ 784 MHz, 16-คอร์ ANE
- หน่วยความจำรวม 128 GB - 16.62 GB ใช้งานขณะไม่ได้ใช้งาน (ประมาณ 13%)
- 6.48 วัตต์ กำลังเดินเบาทั้งหมด สังเกตสูงสุด 46.33 W ความร้อน: เล็กน้อย
- 2TB SSDฟรี 1.9 TB หลังจากการตั้งค่าครั้งแรก
6.48 W ที่ไม่ได้ใช้งานสำหรับเดสก์ท็อปที่มีหน่วยความจำที่ใช้งานได้ 128 GB คือหมายเลขพาดหัวสำหรับฉัน กล่องนี้เป็นอุปกรณ์ AI ที่ใช้พลังงานต่ำและทำงานตลอดเวลาอย่างแท้จริง ซึ่งคุณสามารถเปิดทำงานตลอด 24 ชั่วโมงทุกวันโดยไม่ต้องคำนึงถึงค่าไฟ
เหตุใดฮาร์ดแวร์นี้จึงมีความพิเศษ - หน่วยความจำแบบรวมในหนึ่งย่อหน้า
บนพีซีแบบเดิม CPU ของคุณมี RAM ระบบ และ GPU ของคุณมี VRAM แยกต่างหาก ต้องคัดลอกโมเดลข้าม PCIe ก่อน GPU จึงจะสามารถรันได้ ถ้ารุ่นใหญ่กว่า VRAM ก็ไม่พอดี บน Apple Silicon นั้น CPU, GPU, Neural Engine และเอ็นจิ้นมีเดียจะแชร์กัน หนึ่ง สระน้ำ 128 GB ไม่มีอะไรถูกคัดลอก LLM พารามิเตอร์ 70B ที่ Q4_K_M (ประมาณ 40 GB บนดิสก์ การประมาณการสาธารณะ) โหลดโดยที่ GB ประมาณ 80 ตัวยังคงว่างสำหรับบริบท แอปพลิเคชัน และเครื่องมือ นี่คือสาเหตุที่ทำให้ LLM ในเครื่องรู้สึกแตกต่างบน Mac
จากกล่องถึง LLM แรกในสามคำสั่ง
brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."
นั่นคือการนำขึ้นมาทั้งหมดอย่างแท้จริง การดำเนินการครั้งแรกจะดาวน์โหลดโมเดล (Llama 3.1 8B Q4_K_M อยู่ที่ประมาณ 4.7 GB บนดิสก์ การประมาณการสาธารณะ) และโหลดลงในหน่วยความจำแบบรวม หลังจากนั้นการสตรีมการสนทนาจะราบรื่น โดยมีความล่าช้าของโทเค็นแรกที่เห็นได้ชัดเจนและเอาต์พุตที่สม่ำเสมอผ่านการตอบกลับ ฉันจงใจไม่เผยแพร่ตัวเลขโทเค็นต่อวินาทีที่นี่โดยไม่มีวิธีการวัดประสิทธิภาพที่เหมาะสม บทความยาว ๆ เข้าสู่การให้เหตุผล
RAG ท้องถิ่นใน Python ต่ำกว่า 60 บรรทัด
สิ่งที่มีประโยชน์ที่สุดที่คุณสามารถทำได้กับ LLM ในเครื่องคือการชี้ไปที่เอกสารของคุณเอง สแต็กขั้นต่ำที่ใช้งานได้คือ:
- PyMuPDF หรือ
unstructuredสำหรับการแยกวิเคราะห์ - nomic-embed-text ผ่าน Ollama สำหรับการฝัง
- ChromaDB สำหรับร้านเวกเตอร์
- Llama 3.1 8B ผ่าน Ollama สำหรับรุ่น
รหัสเต็มอยู่ใน บทความยาว. พาดหัวคือ: ทุกอย่างทำงานบน Mac Studio, ไม่มีคีย์ API ภายนอก, ไม่มีการเรียกเก็บเงินต่อโทเค็น, ไม่มีข้อมูลออกจากเครื่อง
Mac Studio กับคลาวด์ - เมทริกซ์การตัดสินใจที่ซื่อสัตย์
Mac Studio ชนะในด้าน: การอนุมานส่วนตัวตลอดเวลา, RAG บนข้อมูลของคุณเอง, โคไพล็อต IDE, การสร้างต้นแบบเอเจนต์, การเรียนรู้สแต็ก และโฮมแล็บ คลาวด์ชนะในด้าน: งานฝึกอบรมที่ระเบิดออกมา, การให้บริการการผลิตมากกว่า 70 พันล้านรายการในวงกว้าง, การรับส่งข้อมูลทั่วโลกที่คาดเดาไม่ได้ และปริมาณงานที่ต้องการการทำงานแบบขนาน A100/H100 ถึง 8 เท่า ทีมส่วนใหญ่จะใช้ทั้งสองอย่าง บทความขนาดยาวมีเมทริกซ์การตัดสินใจแบบเต็มในรูปแบบ SVG
ห้าบทเรียนหลังจากหนึ่งสัปดาห์
- ความเป็นส่วนตัวจะปลดล็อกกรณีการใช้งานใหม่ๆ เมื่อโมเดลอยู่ในเครื่อง ฉันจะวางบันทึกการผลิต เอกสารภายใน และอีเมลของลูกค้าโดยไม่ลังเล นั่นเปลี่ยนวิธีการทำงานของฉัน
- ต้นทุนต่อการสืบค้นขึ้นอยู่กับจิตวิทยาและการเงิน การไม่มีการเรียกเก็บเงินหมายถึงการสืบค้นมากขึ้น การทดลองมากขึ้น และความอยากรู้อยากเห็นมากขึ้น
- 128 GB คือจุดที่น่าสนใจ 64 GB เป็นพื้นสำหรับงานจริงจัง 128 GB ช่วยให้คุณวิ่งได้ 70B ที่ Q4_K_M และยังมีที่ว่างสำหรับอย่างอื่น
- Ollama เป็นทางลาดที่ใช้งานง่าย LM Studio นั้นยอดเยี่ยมในฐานะเบราว์เซอร์แบบจำลอง ส่วน MLX นั้นยอดเยี่ยมหากคุณเริ่มต้นใหม่ใน Python llama.cpp จะสนับสนุนทุกอย่าง
- เมฆยังไม่ตาย ยังคงเป็นเครื่องมือที่เหมาะสมสำหรับการฝึกอบรม การขยายขนาดการให้บริการ และปริมาณงานที่ไม่ทราบจำนวน
อะไรต่อไป
บทความในอนาคตจะครอบคลุมถึงการปรับแต่ง MLX อย่างละเอียดบน Apple Silicon, คลัสเตอร์การอนุมาน multi-Mac ที่มี EXO, Agent Stacks (LangGraph + Ollama) และชิ้นส่วนวิธีการวัดประสิทธิภาพที่เจาะลึกยิ่งขึ้น หากคุณต้องการเวอร์ชันยาวที่มีไดอะแกรม โค้ด และเมทริกซ์การตัดสินใจทั้งหมด โปรดอ่าน บทความยาว. หากคุณต้องการเวอร์ชั่นภาพโปรดดูที่ YouTube แบบสั้น. ไม่ว่าจะด้วยวิธีใดก็ตาม - สมัครรับข้อมูลซีรีส์ที่เหลือ