เส้นทางการแข่งขันจนมาถึงจุดนี้
AI สร้างภาพ (Generative image AI) เป็นการขับเคี่ยวกันระหว่างห้องแล็บไม่กี่แห่งที่มีเงินทุนมหาศาล OpenAI เป็นผู้กำหนดมาตรฐานในช่วงแรกด้วยซีรีส์ GPT-Image; Meta ไล่ตามด้วยงานศิลปะแนวสไตล์ลิสต์ด้วย Muse-Image, Google พัฒนา Gemini สำหรับการสั่งงานด้วยคำสั่งหลายภาษา และ Alibaba เปิดตัว Qwen-Image-3.0-Pro สำหรับภาพประกอบอีคอมเมิร์ซ ส่วน xAI เข้าสู่ตลาดเมื่อปีที่แล้วด้วยรุ่น “Quality” ที่สร้างภาพได้ดีพอสมควร แต่ยังตามหลังในเรื่องการปฏิบัติตามคำสั่งและการควบคุมเลย์เอาต์
Imagine Image 2.0 ถือเป็นการอัปเกรดระดับเจนเนอเรชันครั้งใหญ่ครั้งแรก เมื่อรวมเข้ากับแพลตฟอร์ม Grok โมเดลนี้ได้มุ่งเน้นไปที่สองด้าน ได้แก่ คุณภาพการสร้างภาพดิบ และเครื่องมือการแก้ไขที่ใช้งานได้จริงซึ่งเหมาะกับกระบวนการทำงานระดับมืออาชีพ การเปิดตัวนี้เกิดขึ้นพร้อมกับการผลักดันของอุตสาหกรรมไปสู่การสร้างคอนเทนต์โดยมี AI ช่วยเหลือ ซึ่งความเร็วและความแม่นยำมีความสำคัญไม่แพ้ความสมจริงของภาพ
ตัวเลขที่สำคัญ
Arena ซึ่งเป็นเกณฑ์มาตรฐานอิสระที่นำโมเดลต่างๆ มาประชันกันแบบตัวต่อตัว ได้ประกาศคะแนนล่าสุดเมื่อวันที่ 7 สิงหาคม 2026 โดย Imagine Image 2.0 รุ่น “low” ได้รับคะแนน Elo อยู่ที่ 1,439 ในหมวด Image Edit เมื่อเทียบกับ 1,463 ของ GPT-Image-2 ส่วนในหมวด Text-to-Image โมเดลนี้ทำคะแนนได้ 1,320 เมื่อเทียบกับ 1,380 ของ OpenAI ทำให้ Imagine Image 2.0 ครองอันดับสองของโลกในเกณฑ์มาตรฐาน Arena โดยตามหลัง GPT-Image-2 ของ OpenAI เพียงเล็กน้อยเท่านั้น
นอกเหนือจากสองอันดับแรกแล้ว Imagine Image 2.0 ยังเอาชนะ Muse-Image ของ Meta, Qwen-Image-3.0-Pro ของ Alibaba, Gemini ของ Google และ SeedDream ของ ByteDance ชัยชนะเหล่านี้แสดงให้เห็นว่าโมเดลได้ขยับจากตัวประกอบขึ้นมาเป็นระดับแถวหน้าในด้านประสิทธิภาพที่วัดผลได้ต่อสาธารณะ
เครื่องมือแก้ไขที่มุ่งเน้นการใช้งานจริง
การสร้างภาพดิบเป็นเพียงครึ่งเดียวของเรื่องราวสำหรับนักออกแบบ นักการตลาด และนักพัฒนาเกม Imagine Image 2.0 มาพร้อมกับชุดฟีเจอร์การแก้ไขที่ทำให้มันก้าวเข้าใกล้การเป็นโปรแกรมแก้ไขกราฟิกแบบครบวงจร:
- Magic Wand – แปรงแบบระบุพื้นที่ที่ช่วยแยกส่วนเฉพาะเจาะจงเพื่อทำการแก้ไขเฉพาะจุดโดยไม่กระทบส่วนอื่นของภาพ
- Segmentation – ช่วยให้ผู้ใช้เลือกพื้นที่ได้อย่างแม่นยำ เหมือนกับการใช้มาสก์ (mask) ในซอฟต์แวร์แก้ไขภาพแบบดั้งเดิม
- Background Removal – ส่งออกวัตถุบนผืนผ้าใบโปร่งใส พร้อมสำหรับการนำไปตัดต่อรวมภาพ (compositing)
- Multi-Ref Editing – ผสมผสานภาพต้นฉบับได้สูงสุดถึงห้าภาพเข้าด้วยกันในการสร้างครั้งเดียว ช่วยให้สร้างแนวคิดแบบไฮบริดที่หากไม่ใช้เครื่องมือนี้อาจต้องใช้วิธีการตัดแปะด้วยมือ
- Smart Resize – ใช้เทคนิค generative inpainting เพื่อเติมพิกเซลที่ขาดหายไปเมื่อมีการเปลี่ยนอัตราส่วนภาพ ช่วยรักษาองค์ประกอบภาพในขณะที่ปรับให้เข้ากับรูปแบบใหม่
เทมเพลตที่ตั้งค่าไว้ล่วงหน้าสำหรับภาพถ่ายผลิตภัณฑ์, สินทรัพย์ทางการตลาด, game sprites และ streaming emojis ช่วยให้ขั้นตอนการทำงานตั้งแต่การใส่คำสั่ง (prompt) ไปจนถึงผลลัพธ์นั้นรวดเร็วยิ่งขึ้น ผู้ใช้สามารถเริ่มจากเลย์เอาต์ที่ได้มาตรฐานอุตสาหกรรมอยู่แล้ว จากนั้นจึงปรับแต่งรายละเอียดด้วยเครื่องมือใหม่เหล่านี้
การวางรากฐานสำหรับวิดีโอที่ขับเคลื่อนด้วย AI
แผนงาน (roadmap) ของ xAI บ่งบอกถึงวิสัยทัศน์ระยะยาว นั่นคือการสร้างวิดีโอ ความต่อเนื่องระหว่างเฟรม—การรักษาลักษณะตัวละคร แสง และสภาพแวดล้อมให้เหมือนเดิม—เป็นสิ่งที่ขัดขวางความก้าวหน้าของ generative AI มาอย่างยาวนาน
บทสรุป
Imagine Image 2.0 ทำให้ xAI กลายเป็นคู่แข่งที่น่ากลัวต่อความเป็นผู้นำที่ยาวนานของ OpenAI ต้องขอบคุณคะแนน benchmark ที่แข็งแกร่งและเครื่องมือที่ตอบโจทย์ความต้องการในแต่ละวันของผู้สร้างสรรค์มืออาชีพ อย่างไรก็ตาม โมเดลนี้ยังคงตามหลังในด้านประสิทธิภาพการสร้างภาพดิบ และผลกระทบของมันจะขึ้นอยู่กับว่าผู้ใช้จะยอมรับขั้นตอนการทำงานในการแก้ไขได้รวดเร็วเพียงใด และสตูดิโอจะสามารถเปลี่ยนความต่อเนื่องทางภาพให้กลายเป็นกระบวนการผลิตวิดีโอที่ใช้งานได้จริงหรือไม่ ในอีกไม่กี่เดือนข้างหน้าจะเผยให้เห็นว่าการคว้าอันดับสองนี้เป็นเพียงกระแสชั่วคราว หรือเป็นจุดเริ่มต้นของการเปลี่ยนแปลงอย่างยั่งยืนในตลาดภาพสร้างสรรค์ (generative image market)
