คู่มือสั้น ใช้งานได้จริงเรื่องชั้นโมเดล Claude สำหรับการเจาะลึกเต็มพร้อมพิมพ์เขียว routing แพทเทิร์น prompting และ playbook token-budget อ่าน บทความใหญ่.
claude-haiku-4-5 สำหรับงานเจตนาที่เร็วและถูก, claude-sonnet-5 เพื่อความสมดุลความเร็ว/คุณภาพที่ดีที่สุด, claude-opus-4-8 สำหรับ agentic coding ที่ซับซ้อนและงานองค์กร และสงวน claude-fable-5 (และ gated claude-mythos-5) สำหรับงานที่ยากจริง ๆ ระยะยาว ที่ใช้ชั่วโมงหรือวัน
ไลน์อัปโมเดลในพริบตา
| โมเดล | เหมาะสำหรับ | หน้าต่างบริบท | เอาต์พุตสูงสุด | ราคา (input / output) | พฤติกรรม thinking |
|---|---|---|---|---|---|
Claude Fable 5 (claude-fable-5) |
เอเจนต์รันยาวและปัญหาที่ยากที่สุดยังไม่แก้ | 1M tokens | 128K tokens | $10 / $50 per MTok | Adaptive thinking always on |
Claude Opus 4.8 (claude-opus-4-8) |
Agentic coding ที่ซับซ้อนและงานองค์กร | 1M tokens | 128K tokens | $5 / $25 per MTok | Adaptive thinking always on |
Claude Sonnet 5 (claude-sonnet-5) |
สมดุลความเร็ว/คุณภาพดีที่สุด | 1M tokens | 128K tokens | $3 / $15 per MTok | Adaptive thinking always on |
Claude Haiku 4.5 (claude-haiku-4-5-20251001) |
โมเดลเร็วที่สุดสำหรับงานถูก ปริมาณสูง | 200K tokens | 64K tokens | $1 / $5 per MTok | Extended thinking available (adaptive off) |
Claude Mythos 5 (claude-mythos-5) คือโมเดลแบบ gated ที่ใช้สเปกและราคาเดียวกับ Fable 5 แต่ไม่มี safety classifiers ที่ Fable 5 ใช้ ความพร้อมจำกัดเฉพาะพาร์ทเนอร์ที่อนุมัติผ่าน Project Glasswing
เลือกโมเดลที่ถูก (กฎเร็ว)
- Haiku 4.5: routing, classification, extraction และเวิร์กโฟลว์ใดก็ตามที่ต้องการคำตอบเร็วและแบกรับงบ output-token สูงไม่ได้
- Sonnet 5: การเขียนโค้ดประจำวันและงานเอกสารที่ต้องการคุณภาพสูงโดยไม่ใช้ราคา Opus/Fable
- Opus 4.8: agentic coding ที่ซับซ้อน การวิเคราะห์องค์กร และการดีบักที่ยากขึ้นซึ่งต้องการงานยาวและอิสระกว่า
- Fable 5: ปัญหาที่ยาก ระยะยาว ที่ใช้ชั่วโมงหรือวัน โดยเฉพาะเมื่อโมเดลต้องรักษาเป้าหมาย มอบหมายงานย่อย และคงความสอดคล้อง
Effort และ thinking: ผลต่อต้นทุนอย่างไร
บน API, effort คือตัวควบคุมหลักของ trade-off ระหว่างความฉลาด ความหน่วง และต้นทุนบน Fable 5 และ Mythos 5 สำหรับ Opus 4.8 และ Sonnet 5 คุณตั้ง effort อย่างชัดเจนได้เมื่อต้องการโปรไฟล์ cost/latency อื่น
นัยปฏิบัติ: ค่าเริ่มต้นทุกคำขอเป็น effort สูงสุด มักเป็นวิธีเร็วที่สุดในการเผางบด้วย output tokens
กลยุทธ์โทเคนที่ใช้ได้ทุกชั้น
Claude output tokens คือส่วนที่แพง กฎง่าย ๆ คือ: จำกัดความยาวเอาต์พุต, พรอมต์แบบ TLDR-first, และใช้ prompt caching เพื่อให้ prefix ที่เสถียร (system instructions และ tool schemas) ถูกใช้ซ้ำ
- ใช้โมเดลถูกที่สุดที่ทำจบได้ เราเตอร์ (Haiku -> Sonnet/Opus -> Fable) มักลดต้นทุนอย่างมากโดยยังรักษาคุณภาพสูง
- ตั้งขีดจำกัดเอาต์พุต ในโปรดักชัน ให้ตั้ง max output / token cap เสมอ คำตอบไร้ขอบเขตคืออุบัติเหตุด้านงบ
- ใช้สรุปอย่างมีกลยุทธ์ แทนที่จะส่งทรานสคริปต์เต็มทุกเทิร์น ให้เก็บหน่วยความจำ “lessons” แบบกะทัดรัดแล้วอัปเดตเฉพาะส่วนนั้น
พิมพ์เขียวเราเตอร์ง่าย ๆ
- จำแนกเจตนาและความซับซ้อนโดยประมาณด้วย
claude-haiku-4-5. - ส่งงาน “ยากปกติ” ไปยัง
claude-sonnet-5(หรือclaude-opus-4-8เมื่อคาดว่าจะมี agentic coding ที่หนักขึ้น) - เลื่อนระดับไป
claude-fable-5เฉพาะเมื่องานชัดเจนว่าระยะยาวหรือล้มเหลวบนชั้นล่าง - ถ้า Fable 5 ปฏิเสธผ่าน safety classifiers ให้ถอยไป Opus 4.8 (API รองรับการยิงใหม่พร้อม fallbacks เมื่อตั้งค่าไว้)