| “Gemini 4 Argon” โมเดลปัญญาประดิษฐ์ (AI) ระดับเรือธงที่ Google ซุ่มพัฒนามาเป็นเวลานาน และเพิ่งเปิดตัวสำหรับผู้ใช้บางกลุ่มไปนั้น กำลังเผชิญข้อกังขาจากภายในบริษัทเองเกี่ยวกับประสิทธิภาพของโมเดล โดยเฉพาะในด้านการเขียนโค้ด Google เพิ่งเปิดให้พันธมิตรด้านความปลอดภัยทางไซเบอร์กลุ่มเล็ก ๆ ใช้งานโมเดลนี้ แต่จะเปิดให้ใช้งานในวงกว้างมากขึ้น หลังจากทดสอบเพิ่มเติม เริ่มจากผู้สมัครสมาชิกแบบชำระเงิน บริษัทระบุว่า Gemini 4 ทำคะแนนได้โดดเด่นในการทดสอบมาตรฐานหลายรายการ รวมถึงยังมีคะแนนนำโมเดล Astra ของ OpenAI ในเกณฑวัดหนึ่งที่ประเมินความสามารถด้านความปลอดภัย อย่างไรก็ดี ผู้ที่เกี่ยวข้องโดยตรงภายในบางส่วนระบุว่า ตัวชี้วัดดังกล่าวอาจไม่ได้สะท้อนประสิทธิภาพทั้งหมดของโมเดล แม้ Gemini 4 จะทำผลงานได้ดีในการทดสอบมาตรฐานโดยรวมเพื่อประเมินประสิทธิภาพของโมเดล แต่กลับทำผลงานได้ไม่ดีเท่าที่ควรเมื่อนำไปใช้งานจริง โดยแหล่งข่าวระบุว่าโมเดลมีปัญหาในงานเขียนโค้ดบางประเภท ช่วงที่ผ่านมา Google พยายามอย่างหนักในการพัฒนาโมเดลเพื่อแข่งขันกับ OpenAI และ Anthropic โดยบริษัทเคยวางแผนเปิดตัวโมเดลอีกรุ่นเมื่อเดือนมิ.ย. ซึ่งมีชื่อว่า Gemini 3.5 Pro แต่ได้ยกเลิกแผนดังกล่าว ขณะเดียวกัน Google ออกมาโต้แย้งว่า การกล่าวว่า Gemini 4 ทำผลงานได้ต่ำกว่าคาดในด้านต่าง ๆ เช่น การเขียนโค้ดนั้นไม่ถูกต้อง โดยบริษัทอ้างถึงความเห็นของโคเรย์ คาวุกคูโอกลู หัวหน้าทีม Google DeepMind เมื่อสัปดาห์ที่ผ่านมา ซึ่งระบุว่า เขาพอใจกับประสิทธิภาพของโมเดลดังกล่าว สำหรับคนใน Google เองยังมีมุมมองที่หลากหลาย โดยบางส่วนมองว่าโมเดล Fable ของ Anthropic และ Astra ของ OpenAI พัฒนาไปเร็วกว่า Gemini และยังเชื่อว่า แม้ Gemini 4 จะโชว์ศักยภาพขั้นสุดออกมาแล้วก็ตาม แต่ก็ยังตามหลังโมเดลคู่แข่งในบางด้าน ขณะที่พนักงานอีกกลุ่มยังเชื่อมั่นว่า โมเดลรุ่นใหม่ไล่ทันโมเดลจากผู้พัฒนา AI ชั้นนำ พนักงาน Google รายหนึ่งซึ่งคุ้นเคยกับการพัฒนาโมเดลระบุว่า คนในบริษัทส่วนใหญ่มีความเห็นไปในทางเดียวกันว่า Gemini 4 อยู่ระดับแนวหน้าของอุตสาหกรรม โดยบุคคลดังกล่าวระบุว่า บริษัทได้ทดสอบโมเดลอย่างเข้มงวด และปฏิเสธข้อกล่าวหาที่ว่าโมเดลมีปัญหากับงานเขียนโค้ดที่ซับซ้อนและเกิดขึ้นในโลกจริง ปรากฏการณ์ ‘Benchmaxxing’ เมื่อคะแนนไม่สะท้อนประสิทธิภาพที่แท้จริง ผู้เชี่ยวชาญระบุว่า Google อาจกำลังเผชิญปัญหาที่เกิดขึ้นในอุตสาหกรรม AI นั่นคือการให้ความสำคัญกับคะแนนการทดสอบมาตรฐานมากเกินไป หรือที่เรียกว่า “Benchmaxxing” ซึ่งมุ่งเน้นการทำคะแนนให้สูง มากกว่าการสร้างผลิตภัณฑ์ที่สามารถทำงานในสถานการณ์จริงได้อย่างมีประสิทธิภาพ ผู้พัฒนา AI มักให้ความสำคัญกับเรื่องนี้ เนื่องจากลูกค้ามักใช้คะแนนจากการทดสอบมาตรฐานเป็นเกณฑ์ในการประเมินโมเดล โดยแหล่งข่าววงในระบุว่า Gemini 4 น่าจะได้รับผลกระทบจากกระบวนการนี้ เอ็ดวิน เฉิน ผู้ก่อตั้ง “Surge AI” ซึ่งเป็นสตาร์ทอัพด้าน AI กล่าวว่า การพึ่งพาคะแนนทดสอบอาจทำให้ห้องปฏิบัติการ AI มุ่งพัฒนาโมเดลให้เขียนโค้ดในภาษาบางประเภทได้ดี แทนที่จะมุ่งสร้างแอปพลิเคชันที่ใช้งานง่ายหรือมีการออกแบบที่ดี ซึ่งเปรียบได้กับการบอกว่า “ลูกของฉันทำคะแนน SAT ได้ดีมาก แต่คะแนน SAT ก็ไม่ได้สะท้อนความสามารถในโลกการทำงาน ซึ่งเป็นปัญหาที่ร้ายแรงมาก” อย่างไรก็ตาม วงในระบุว่า Gemini 4 มีจุดแข็งเช่นกัน โดยเฉพาะการทำความเข้าใจข้อมูลที่นอกเหนือจากข้อความ เช่น การดึงข้อมูล Metadata จากวิดีโอ นอกจากนี้ยังชี้ถึงความสามารถด้านความปลอดภัย ความปลอดภัยทางไซเบอร์ รวมถึงความสามารถในการสื่อสารได้อย่างชัดเจนและเป็นธรรมชาติ ที่มา Bloomberg |