Google DeepMind เปิดตัว GenCeption — เมื่อเครื่องมือสร้างวิดีโอกลายเป็นระบบวิเคราะห์ภาพอเนกประสงค์
ทำลายกรอบเดิม “หนึ่งโมเดล หนึ่งงาน” ในคอมพิวเตอร์วิชัน
Google DeepMind เปิดตัว GenCeption โมเดลวิชันที่นำเสนอแนวคิดใหม่: ใช้โมเดลสร้างวิดีโอที่ผ่านการฝึกฝนมาแล้ว (pre-trained video generator) เป็นเครื่องมือวิเคราะห์ภาพแบบหลายภารกิจ (multi-task analysis engine) ในรอบ forward pass เดียว
ความสามารถหลัก 5 ด้าน
GenCeption สร้างขึ้นบนโมเดล Wan2.1 ของ Alibaba และสามารถทำงานวิเคราะห์ภาพได้ 5 ภารกิจหลักจากการป้อนข้อความเดียว:
- การประมาณความลึก (Depth Estimation) — วัดระยะทางของวัตถุในภาพ
- การแบ่งส่วนภาพ (Image Segmentation) — แยกวัตถุต่างๆ ออกจากกัน
- การประมาณท่าทาง 3 มิติ (3D Pose Estimation) — ระบุตำแหน่งข้อต่อและท่าทางของมนุษย์
- การรู้จำวัตถุข้ามโดเมน — ทำงานกับภาพจริงและหมวดหมู่ที่ไม่เคยเห็นมาก่อน เช่น สัตว์และหุ่นยนต์
- งานวิเคราะห์ภาพเพิ่มเติมอีกสองรายการ
จุดเด่นที่น่าทึ่ง
สิ่งที่ทำให้ GenCeption โดดเด่นคือใช้ ข้อมูลฝึกเพียง 7,500 คลิปวิดีโอสังเคราะห์ — น้อยมากเมื่อเทียบกับโมเดลเฉพาะทางแบบดั้งเดิม แต่สามารถเทียบหรือเหนือกว่าโมเดลเฉพาะทางอย่าง DepthAnything ได้
นอกจากนี้ GenCeption ยังแสดงความสามารถในการปรับตัวข้ามโดเมน (cross-domain adaptability) จัดการวิดีโอจริงที่มีคนหลายคนและหมวดหมู่ที่ไม่เคยเห็นระหว่างฝึก เช่น สัตว์และหุ่นยนต์ได้อย่างมีประสิทธิภาพ
ความท้าทายที่เหลืออยู่
ข้อจำกัดของ GenCeption คือความเร็วในการประมวลผลและความสมดุลของการฝึกแบบหลายภารกิจที่ “ยังมีพื้นที่สำหรับการปรับปรุง” อย่างไรก็ตาม แนวคิดของการใช้โมเดลสร้างวิดีโอเป็นระบบวิเคราะห์ภาพอเนกประสงค์เปิดทางไปสู่สถาปัตยกรรม AI วิชันรุ่นใหม่ที่ประหยัดทรัพยากรมากขึ้น