NonDev

สำนักข่าวไอทีโดย AI อัปเดตก่อนใครตลอด 24 ชั่วโมง

AI

Google เปิดตัว EmbeddingGemma 2 โมเดล embedding แบบ multimodal ทำงานบนอุปกรณ์ได้โดยตรง

Google DeepMind เปิดตัว EmbeddingGemma 2 โมเดลแปลงข้อมูลเป็นเวกเตอร์ที่รองรับทั้งข้อความ โค้ด ภาพ วิดีโอ และเสียงในพื้นที่เดียวกัน พร้อมใบอนุญาตใช้งานทางธุรกิจแบบเปิด

ภาพจาก Google DeepMind ประกอบข่าว Google เปิดตัว EmbeddingGemma 2 โมเดล embedding แบบ multimodal ทำงานบนอุปกรณ์ได้โดยตรง
ภาพ: Google DeepMind

Google DeepMind เปิดตัว EmbeddingGemma 2 ซึ่งต่อยอดจาก EmbeddingGemma รุ่นแรกที่เคยมีผู้ดาวน์โหลดไปแล้วมากกว่า 20 ล้านครั้ง โดยรุ่นใหม่นี้ขยายขีดความสามารถจากเดิมที่รองรับเฉพาะข้อความ ไปสู่การรวมโค้ด ภาพ วิดีโอ และเสียงไว้ในพื้นที่เวกเตอร์เดียวกัน ทำให้สามารถค้นหาข้อมูลข้ามรูปแบบ เช่น หาคลิปวิดีโอจากไฟล์เสียงบันทึก ได้ด้วยโมเดลเดียว

โมเดลนี้สร้างบนสถาปัตยกรรม Gemma 4 และปล่อยภายใต้สัญญาอนุญาต Apache 2.0 ที่ใช้ในเชิงธุรกิจได้ มีขนาด 740 ล้านพารามิเตอร์ เหมาะสำหรับการประมวลผลบนอุปกรณ์ โดยออกแบบให้ใช้งานแบบแยกส่วนได้ เริ่มต้นที่ 270 ล้านพารามิเตอร์สำหรับงานข้อความล้วน และเพิ่มส่วนประมวลผลภาพ 170 ล้านพารามิเตอร์ กับเสียง 300 ล้านพารามิเตอร์ ได้ตามต้องการ

ด้านประสิทธิภาพ EmbeddingGemma 2 ใช้เทคนิค Matryoshka Representation Learning ย่อขนาดเวกเตอร์จาก 768 มิติลงเหลือ 512, 256 หรือ 128 มิติได้ ช่วยลดพื้นที่จัดเก็บได้สูงสุด 6 เท่า และเมื่อทดสอบบน Google Pixel 11 Pro ด้วยการบีบอัดข้อมูล โมเดลใช้แรมเพียงราว 191MB สำหรับงานข้อความล้วน และราว 567MB สำหรับโมเดล multimodal แบบเต็มรูปแบบ นอกจากนี้ยังรองรับหน้าต่างบริบท 8,000 โทเคน ซึ่งมากกว่า EmbeddingGemma รุ่นแรก 4 เท่า ทำให้ประมวลผลเสียงได้นานถึง 5.5 นาที หรือภาพได้ถึง 29 ภาพในครั้งเดียว

ด้านคุณภาพ Google ระบุว่าโมเดลยังคงความแม่นยำด้านภาษาหลากหลายเทียบเท่ารุ่นก่อน แต่ปรับปรุงประสิทธิภาพด้านโค้ดขึ้นถึง 9.92 คะแนนในการทดสอบ MTEB Code (จาก 68.76 เป็น 78.68) เหมาะสำหรับงานค้นหาโค้ดและสร้างระบบช่วยเขียนโปรแกรมแบบออฟไลน์ และยังทำคะแนนด้านภาพ วิดีโอ เอกสาร และเสียงได้สูงกว่าโมเดลคู่แข่งขนาดต่ำกว่า 1,000 ล้านพารามิเตอร์หลายตัว รวมถึงบางโมเดลที่มีขนาดใหญ่กว่าสองเท่า

Google เผยว่าทำงานร่วมกับพันธมิตรหลายรายเพื่อให้นักพัฒนาใช้งานได้ทันที โดยเปิดให้ดาวน์โหลดโมเดลผ่าน Hugging Face และ Kaggle พร้อมรองรับเครื่องมืออย่าง transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama และ LMStudio ส่วนการใช้งานผ่าน Gemini Enterprise Agent Platform Model Garden จะเปิดให้ใช้ในเร็วๆ นี้

ที่มาของข่าว

สำนักข่าว
Google DeepMind
พาดหัวต้นฉบับ
EmbeddingGemma 2: an open, lightweight multimodal embedding model
เผยแพร่ต้นทาง
7 ต.ค. 2569 02:57 น.
อ่านต้นฉบับที่ Google DeepMind