AI Cold Start: ทำไม AI บางครั้ง คิดนาน ก่อนตอบ
บางครั้ง เรา Prompt ไปแล้ว AI เงียบไปหลายวินาที ก่อนจะเริ่มตอบ ทั้งที่ Request ครั้งต่อไปกลับเร็วขึ้นมาก
อาจไม่ใช่เรื่องของ Model ที่คิดช้า แต่เป็นปัญหาที่เรียกว่า AI Cold Start
1. Model Loading
ก่อนที่ Model จะเริ่ม Inference ได้ ระบบอาจต้องโหลด Model จาก Storage เข้าไปยัง RAM หรือ GPU Memory
สำหรับ LLM ขนาดใหญ่ กระบวนการนี้อาจใช้เวลาตั้งแต่ไม่กี่วินาทีไปจนถึงนานกว่านั้น ขึ้นอยู่กับขนาด Model, Storage และ Network
Model ใหญ่ > Load นาน > First Token ช้า
2. GPU Memory
LLM ไม่ได้ใช้ GPU แค่ตอนคำนวณ แต่ต้องเก็บ Model Weights และ Runtime State ไว้ใน Memory ด้วย
หาก GPU ยังไม่มี Model อยู่ ระบบต้องโหลดเข้า GPU ก่อนจึงจะเริ่ม Inference ได้
นี่เป็นเหตุผลหนึ่งที่ Warm Instance มักตอบเร็วกว่า Cold Instance อย่างชัดเจน
3. Container Startup
ในระบบ Production AI อาจมี Container ที่ต้องถูกสร้างขึ้นใหม่เมื่อไม่มี Instance พร้อมใช้งาน
ขั้นตอนอาจเป็น
Request → Container Start → Load Runtime → Load Model → GPU Init → Inference
ผู้ใช้จึงรู้สึกว่า AI คิดนาน ทั้งที่เวลาส่วนหนึ่งไม่ได้ใช้ในการ Generate คำตอบเลย
4. Serverless AI
Serverless ช่วยให้ระบบ Scale ตาม Traffic และลด Infrastructure Cost ได้ แต่มี Trade-off คือ Cold Start
เมื่อ Traffic ลดลง ระบบอาจ Scale ลงจนไม่มี Instance ทำงานอยู่
Request แรกหลังจากนั้นจึงต้องจ่าย “ค่าเริ่มต้นระบบ” ก่อน
แก้ไขอย่างไร?
AI Production ไม่ได้วัดแค่ Inference Latency
แต่ต้องดู
Cold Start → Model Loading → Queue → Time to First Token → Token Generation
เทคนิคที่ใช้ เช่น Keep-Warm Instance, Model Preloading, GPU Pooling, Quantization และ Intelligent Routing
ในทางปฏิบัติ
“AI ที่ฉลาด” อาจยังไม่ดีพอ หากใช้เวลานานเกินกว่าที่ผู้ใช้จะรอ
ทำให้ AI Latency Engineering กลายเป็นอีกหนึ่งส่วนสำคัญของ AI Engineering