AI Infrastructure และ GPU Compute ในประเทศไทย
GPU Cluster, ML Pipeline และ Compute ที่ขยายได้ สำหรับงาน AI ระดับหนัก เราออกแบบและดูแลโครงสร้างที่ใช้ฝึกและให้บริการโมเดลของคุณ ทั้งแบบ On-premise และ Cloud สำหรับองค์กรทั่วประเทศไทย
GPU Compute และแพลตฟอร์ม MLOps ที่จัดขนาดตามงานที่ท่านรันจริง พร้อมติดตั้งแบบ On-premise เมื่ออธิปไตยข้อมูลกำหนด สำหรับหน่วยงานรัฐและภาคที่มีกฎกำกับของไทย ข้อจำกัดนั้นมักตัดสินสถาปัตยกรรมก่อนที่จะมีคำถามเรื่องประสิทธิภาพเสียอีก
คุณสมบัติหลัก
GPU Cluster
จัดหาและดูแล GPU สำหรับการฝึกและ Inference ปริมาณสูง
ML Pipeline
Pipeline ที่ทำซ้ำได้ สำหรับเตรียมข้อมูล ฝึก และ Deploy
Model Serving
ให้บริการโมเดลที่ Latency ต่ำและขยายได้ สำหรับงาน Production
On-Prem หรือ Cloud
Deploy ตามความต้องการด้านข้อมูลและกฎระเบียบ รวมถึง Data Sovereignty
ขั้นตอนการทำงาน
เก็บความต้องการ
ประเมินปริมาณงาน Throughput และข้อกำหนดที่ตั้งของข้อมูล
ออกแบบสถาปัตยกรรม
ออกแบบ GPU, Storage และเน็ตเวิร์กให้เหมาะกับงาน AI
สร้างระบบ
จัดเตรียม Compute, Pipeline และระบบ Serving
ดูแลระบบ
Monitor การใช้งาน ต้นทุน และประสิทธิภาพ พร้อมขยายตามต้องการ
เทคโนโลยีที่ใช้
ประโยชน์ที่ได้รับ
GPU แบบ On-premise และกรณีที่เป็นทางเลือกเดียว
การจัดซื้อจัดจ้างภาครัฐไทยและภาคที่มีกฎกำกับ มักกำหนดว่าข้อมูลต้องไม่ออกจากองค์กร ในกรณีนั้น GPU บนคลาวด์ไม่ใช่ตัวเลือกที่จะเอามาปรับให้ดีขึ้น แต่ถูกตัดออกไปเลย และสถาปัตยกรรมก็ตามมาจากข้อจำกัดนั้น ไม่ใช่จากเรื่องราคาหรือประสิทธิภาพ
ในกรณีที่ใช้คลาวด์ได้ มักถูกกว่าในการเริ่มต้น และเราจะบอกตรง ๆ โดยเฉพาะงานฝึกโมเดลที่ทำเป็นครั้งคราว ซึ่งการจ่ายค่าฮาร์ดแวร์ที่นั่งว่างไม่สมเหตุสมผล การเป็นเจ้าของ GPU คุ้มเมื่อการใช้งานสูงและต่อเนื่องจริง
การเปรียบเทียบที่คนมักทำผิดคือการไม่คิดถึงอัตราการใช้งาน เซิร์ฟเวอร์ GPU ที่ทำงานอยู่ 15% มีต้นทุนต่อชั่วโมงที่ใช้ประโยชน์ได้แพงกว่าคลาวด์แบบ On-demand มาก และการประมาณครั้งแรกว่าฮาร์ดแวร์จะยุ่งแค่ไหน มักมองโลกในแง่ดีเกินจริง
จัดขนาดให้ตรงกับงานที่มีอยู่จริง
การฝึกโมเดลกับการให้บริการโมเดลมีรูปแบบต่างกัน การฝึกเป็นแบบพุ่งเป็นช่วงและกินหน่วยความจำ ส่วนการให้บริการเป็นแบบคงที่ ไวต่อ Latency และมักทำงานได้ดีกว่าบนฮาร์ดแวร์ที่เล็กและถูกกว่า การจัดเครื่องเดียวให้ทำทั้งสองอย่างมักได้ของแพงที่ไม่เหมาะกับอะไรเลย
เราจัดขนาดตามภาระงานที่วัดได้จริง ไม่ใช่ตามสเปกที่ประกาศของโมเดล ความผิดพลาดที่พบบ่อยและแพงที่สุดคือการซื้อเผื่อจุดพีคที่เกิดปีละสองครั้ง ทั้งที่ระบบถาวรขนาดเล็กกว่าบวกกำลังสำรองชั่วคราวรองรับความต้องการเดียวกันได้ด้วยต้นทุนเศษเสี้ยว
MLOps ส่วนที่ทำให้ใช้งานได้จริง
ฮาร์ดแวร์อย่างเดียวไม่ใช่แพลตฟอร์ม สิ่งที่เปลี่ยนเซิร์ฟเวอร์ GPU ให้เป็นระบบที่ทีมทำงานร่วมกันได้โดยไม่ชนกัน คือ Pipeline การฝึกที่ทำซ้ำได้ การทำ Version ของโมเดลและชุดข้อมูล การติดตามการทดลอง และการให้บริการโมเดลที่มีการเฝ้าระวัง
หากไม่ทำ Version ทั้งข้อมูลและโมเดล ผลลัพธ์จะทำซ้ำไม่ได้ และคำถามว่า "ทำไมถึงทำนายแบบนั้น" ก็ตอบไม่ได้ ซึ่งสำคัญทั้งเชิงธุรกิจ และสำคัญตาม PDPA ในกรณีที่การตัดสินใจกระทบตัวบุคคล
เราส่งมอบการกำหนดแพลตฟอร์มในรูปโค้ด เพื่อให้สร้างสภาพแวดล้อมใหม่ได้ ไม่ต้องประกอบจากความทรงจำ และเพื่อให้ทีมถัดไปของท่านรับช่วงสิ่งที่อ่านเข้าใจได้
บริการที่เกี่ยวข้อง
คำถามที่พบบ่อย
มีบริการ GPU Compute ไหม?+
มีครับ ทั้ง GPU Cluster สำหรับฝึกโมเดลและ Inference ปริมาณสูง
รันแบบ On-premise ได้ไหม?+
ได้ครับ ทั้ง On-premise เพื่ออธิปไตยข้อมูล บน Cloud หรือแบบ Hybrid
ดูแล ML Pipeline ให้ด้วยไหม?+
ดูแลครับ ทั้ง Pipeline ที่ทำซ้ำได้สำหรับเตรียมข้อมูล ฝึก และ Deploy