AI Infrastructure

AI Infrastructure และ GPU Compute ในประเทศไทย

GPU Cluster, ML Pipeline และ Compute ที่ขยายได้ สำหรับงาน AI ระดับหนัก เราออกแบบและดูแลโครงสร้างที่ใช้ฝึกและให้บริการโมเดลของคุณ ทั้งแบบ On-premise และ Cloud สำหรับองค์กรทั่วประเทศไทย

GPU Compute และแพลตฟอร์ม MLOps ที่จัดขนาดตามงานที่ท่านรันจริง พร้อมติดตั้งแบบ On-premise เมื่ออธิปไตยข้อมูลกำหนด สำหรับหน่วยงานรัฐและภาคที่มีกฎกำกับของไทย ข้อจำกัดนั้นมักตัดสินสถาปัตยกรรมก่อนที่จะมีคำถามเรื่องประสิทธิภาพเสียอีก

GPU Cluster — 4× NVIDIA A100GPU0GPU1GPU2GPU3GPU Memory Usage71%Training ActiveEpoch 47/100Throughput12.4K tok/s

คุณสมบัติหลัก

GPU Cluster

จัดหาและดูแล GPU สำหรับการฝึกและ Inference ปริมาณสูง

ML Pipeline

Pipeline ที่ทำซ้ำได้ สำหรับเตรียมข้อมูล ฝึก และ Deploy

Model Serving

ให้บริการโมเดลที่ Latency ต่ำและขยายได้ สำหรับงาน Production

On-Prem หรือ Cloud

Deploy ตามความต้องการด้านข้อมูลและกฎระเบียบ รวมถึง Data Sovereignty

ขั้นตอนการทำงาน

1

เก็บความต้องการ

ประเมินปริมาณงาน Throughput และข้อกำหนดที่ตั้งของข้อมูล

2

ออกแบบสถาปัตยกรรม

ออกแบบ GPU, Storage และเน็ตเวิร์กให้เหมาะกับงาน AI

3

สร้างระบบ

จัดเตรียม Compute, Pipeline และระบบ Serving

4

ดูแลระบบ

Monitor การใช้งาน ต้นทุน และประสิทธิภาพ พร้อมขยายตามต้องการ

เทคโนโลยีที่ใช้

NVIDIA GPUKubernetesRayKubeflowMLflowTritonSlurmS3

ประโยชน์ที่ได้รับ

Compute พอดีกับงาน AI ของคุณ
มีตัวเลือก On-premise เพื่ออธิปไตยข้อมูล
ML Pipeline ที่ทำซ้ำได้
ให้บริการโมเดล Latency ต่ำ
ใช้ GPU อย่างคุ้มต้นทุน
ขยายได้ตั้งแต่ Pilot จนถึง Production

GPU แบบ On-premise และกรณีที่เป็นทางเลือกเดียว

การจัดซื้อจัดจ้างภาครัฐไทยและภาคที่มีกฎกำกับ มักกำหนดว่าข้อมูลต้องไม่ออกจากองค์กร ในกรณีนั้น GPU บนคลาวด์ไม่ใช่ตัวเลือกที่จะเอามาปรับให้ดีขึ้น แต่ถูกตัดออกไปเลย และสถาปัตยกรรมก็ตามมาจากข้อจำกัดนั้น ไม่ใช่จากเรื่องราคาหรือประสิทธิภาพ

ในกรณีที่ใช้คลาวด์ได้ มักถูกกว่าในการเริ่มต้น และเราจะบอกตรง ๆ โดยเฉพาะงานฝึกโมเดลที่ทำเป็นครั้งคราว ซึ่งการจ่ายค่าฮาร์ดแวร์ที่นั่งว่างไม่สมเหตุสมผล การเป็นเจ้าของ GPU คุ้มเมื่อการใช้งานสูงและต่อเนื่องจริง

การเปรียบเทียบที่คนมักทำผิดคือการไม่คิดถึงอัตราการใช้งาน เซิร์ฟเวอร์ GPU ที่ทำงานอยู่ 15% มีต้นทุนต่อชั่วโมงที่ใช้ประโยชน์ได้แพงกว่าคลาวด์แบบ On-demand มาก และการประมาณครั้งแรกว่าฮาร์ดแวร์จะยุ่งแค่ไหน มักมองโลกในแง่ดีเกินจริง

จัดขนาดให้ตรงกับงานที่มีอยู่จริง

การฝึกโมเดลกับการให้บริการโมเดลมีรูปแบบต่างกัน การฝึกเป็นแบบพุ่งเป็นช่วงและกินหน่วยความจำ ส่วนการให้บริการเป็นแบบคงที่ ไวต่อ Latency และมักทำงานได้ดีกว่าบนฮาร์ดแวร์ที่เล็กและถูกกว่า การจัดเครื่องเดียวให้ทำทั้งสองอย่างมักได้ของแพงที่ไม่เหมาะกับอะไรเลย

เราจัดขนาดตามภาระงานที่วัดได้จริง ไม่ใช่ตามสเปกที่ประกาศของโมเดล ความผิดพลาดที่พบบ่อยและแพงที่สุดคือการซื้อเผื่อจุดพีคที่เกิดปีละสองครั้ง ทั้งที่ระบบถาวรขนาดเล็กกว่าบวกกำลังสำรองชั่วคราวรองรับความต้องการเดียวกันได้ด้วยต้นทุนเศษเสี้ยว

MLOps ส่วนที่ทำให้ใช้งานได้จริง

ฮาร์ดแวร์อย่างเดียวไม่ใช่แพลตฟอร์ม สิ่งที่เปลี่ยนเซิร์ฟเวอร์ GPU ให้เป็นระบบที่ทีมทำงานร่วมกันได้โดยไม่ชนกัน คือ Pipeline การฝึกที่ทำซ้ำได้ การทำ Version ของโมเดลและชุดข้อมูล การติดตามการทดลอง และการให้บริการโมเดลที่มีการเฝ้าระวัง

หากไม่ทำ Version ทั้งข้อมูลและโมเดล ผลลัพธ์จะทำซ้ำไม่ได้ และคำถามว่า "ทำไมถึงทำนายแบบนั้น" ก็ตอบไม่ได้ ซึ่งสำคัญทั้งเชิงธุรกิจ และสำคัญตาม PDPA ในกรณีที่การตัดสินใจกระทบตัวบุคคล

เราส่งมอบการกำหนดแพลตฟอร์มในรูปโค้ด เพื่อให้สร้างสภาพแวดล้อมใหม่ได้ ไม่ต้องประกอบจากความทรงจำ และเพื่อให้ทีมถัดไปของท่านรับช่วงสิ่งที่อ่านเข้าใจได้

บริการที่เกี่ยวข้อง

คำถามที่พบบ่อย

มีบริการ GPU Compute ไหม?+

มีครับ ทั้ง GPU Cluster สำหรับฝึกโมเดลและ Inference ปริมาณสูง

รันแบบ On-premise ได้ไหม?+

ได้ครับ ทั้ง On-premise เพื่ออธิปไตยข้อมูล บน Cloud หรือแบบ Hybrid

ดูแล ML Pipeline ให้ด้วยไหม?+

ดูแลครับ ทั้ง Pipeline ที่ทำซ้ำได้สำหรับเตรียมข้อมูล ฝึก และ Deploy

พร้อมเริ่มแล้วใช่ไหม?

นัดประเมินฟรี และรับใบเสนอราคาคงที่สำหรับระบบของท่าน

ขอประเมินระบบ IT ฟรี