Skip to content

Google DeepMind เปิดตัว GenCeption — ปฏิวัติคอมพิวเตอร์วิชันด้วยวิดีโอเจนเนอเรเตอร์

Google DeepMind เปิดตัว GenCeption — เมื่อเครื่องมือสร้างวิดีโอกลายเป็นระบบวิเคราะห์ภาพอเนกประสงค์

ทำลายกรอบเดิม “หนึ่งโมเดล หนึ่งงาน” ในคอมพิวเตอร์วิชัน

Google DeepMind เปิดตัว GenCeption โมเดลวิชันที่นำเสนอแนวคิดใหม่: ใช้โมเดลสร้างวิดีโอที่ผ่านการฝึกฝนมาแล้ว (pre-trained video generator) เป็นเครื่องมือวิเคราะห์ภาพแบบหลายภารกิจ (multi-task analysis engine) ในรอบ forward pass เดียว

ความสามารถหลัก 5 ด้าน

GenCeption สร้างขึ้นบนโมเดล Wan2.1 ของ Alibaba และสามารถทำงานวิเคราะห์ภาพได้ 5 ภารกิจหลักจากการป้อนข้อความเดียว:

  1. การประมาณความลึก (Depth Estimation) — วัดระยะทางของวัตถุในภาพ
  2. การแบ่งส่วนภาพ (Image Segmentation) — แยกวัตถุต่างๆ ออกจากกัน
  3. การประมาณท่าทาง 3 มิติ (3D Pose Estimation) — ระบุตำแหน่งข้อต่อและท่าทางของมนุษย์
  4. การรู้จำวัตถุข้ามโดเมน — ทำงานกับภาพจริงและหมวดหมู่ที่ไม่เคยเห็นมาก่อน เช่น สัตว์และหุ่นยนต์
  5. งานวิเคราะห์ภาพเพิ่มเติมอีกสองรายการ

จุดเด่นที่น่าทึ่ง

สิ่งที่ทำให้ GenCeption โดดเด่นคือใช้ ข้อมูลฝึกเพียง 7,500 คลิปวิดีโอสังเคราะห์ — น้อยมากเมื่อเทียบกับโมเดลเฉพาะทางแบบดั้งเดิม แต่สามารถเทียบหรือเหนือกว่าโมเดลเฉพาะทางอย่าง DepthAnything ได้

นอกจากนี้ GenCeption ยังแสดงความสามารถในการปรับตัวข้ามโดเมน (cross-domain adaptability) จัดการวิดีโอจริงที่มีคนหลายคนและหมวดหมู่ที่ไม่เคยเห็นระหว่างฝึก เช่น สัตว์และหุ่นยนต์ได้อย่างมีประสิทธิภาพ

ความท้าทายที่เหลืออยู่

ข้อจำกัดของ GenCeption คือความเร็วในการประมวลผลและความสมดุลของการฝึกแบบหลายภารกิจที่ “ยังมีพื้นที่สำหรับการปรับปรุง” อย่างไรก็ตาม แนวคิดของการใช้โมเดลสร้างวิดีโอเป็นระบบวิเคราะห์ภาพอเนกประสงค์เปิดทางไปสู่สถาปัตยกรรม AI วิชันรุ่นใหม่ที่ประหยัดทรัพยากรมากขึ้น

← Back to Blog RSS

Read More

Related Articles

Research

ผู้เชี่ยวชาญชี้กลยุทธ์ AI ไทยกำลังตามหลัง — กฎหมายดิจิทัลต้องยกเครื่องครั้งใหญ่

ผู้เชี่ยวชาญด้าน AI และดิจิทัลของไทยออกมาเตือนว่ากลยุทธ์ AI ของไทยกำลังตามหลังประเทศเพื่อนบ้าน กฎหมายดิจิทัลที่ล้าสมัยต้องได้รับการปรับปรุงครั้งใหญ่

Research

Anthropic เผย Claude ค้นพบจุดอ่อนในการเข้ารหัส — เปิดตัว CryptanalysisBench

Anthropic เปิดเผยว่า Claude ค้นพบช่องโหว่ในอัลกอริทึมการเข้ารหัสที่ส่งเข้ารับการมาตรฐานสากล พร้อมเปิดตัว CryptanalysisBench สำหรับประเมินความสามารถด้านการถอดรหัสของ AI

Research

ธนาคารกลางโลกเตือน AI ทำให้แนวโน้มเงินเฟ้ออ่านยากขึ้น — เสี่ยงนโยบายการเงินผิดพลาด

ธนาคารเพื่อการชำระหนี้ระหว่างประเทศ (BIS) เตือนว่า AI กำลังทำให้แนวโน้มเงินเฟ้อแยกแยะได้ยากขึ้น ส่งผลให้ธนาคารกลางเสี่ยงกำหนดนโยบายการเงินผิดพลาด