GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Fable 5’s ‘Vision-Only’ Pokémon Run Was a Cheat Sheet, Not Real Perception

Running Anthropic’s Fable 5 on a Chinese-language Pokémon FireRed, the model snagged its first gym badge in 1,785 turns for just $65.40, but log analysis shows it repeatedly cited events before they showed on screen, proving it leaned on memorized game scripts rather than true visual reasoning.

AI · 4 min read

ทีม Gemini 3.5 Flash ทำความแม่นยำสูงถึง 87% แซงหน้าทั้งบอทเดี่ยวและการโหวตแบบกลุ่ม

Gemini 3.5 Flash จำนวน 5 อินสแตนซ์ได้ร่วมมือกันทำชุดโจทย์ Project Euler จำนวน 30 ข้อ โดยสามารถทำความถูกต้องได้ถึง 87% และลดเวลาเฉลี่ยในการทำงานจาก 14 นาที เหลือเพียง 10 นาที ซึ่งมีประสิทธิภาพเหนือกว่าทั้งเอเจนต์เดี่ยว (72%) และการโหวตแบบเสียงข้างมาก (80% สำหรับแบบเดี่ยว และ 90% สำหรับแบบร่วมมือกัน)

AI · 3 min read

กฎใหม่ของ Codeberg นำโฮสต์ที่ไม่แสวงหาผลกำไรมาปะทะกับสแปมที่สร้างโดย AI

การสั่งห้ามของ Codeberg ไม่ใช่เรื่องของวัฒนธรรม แต่เป็นเรื่องของขีดความสามารถในการรองรับ Codeberg เพิ่งมีการเปลี่ยนแปลงกฎเกณฑ์ โดย Git forge ที่ไม่แสวงหาผลกำไรแห่งนี้ได้สั่งห้าม repository ที่ประกอบด้วยโค้ดส่วนใหญ่ที่สร้างมาจาก genera…

AI · 2 min read

SigNoz AI Agents ค้นหาสาเหตุที่แท้จริงได้ภายใน 4 วินาที ด้วยราคาเพียง $0.0013 ต่อเหตุการณ์

เอเจนต์อัตโนมัติ 2 ตัวบน Managed Cloud Platform ของ SigNoz สามารถรัน SRE playbook แบบ 5 ขั้นตอน, ส่งการ์ดสรุปสาเหตุไปยัง Slack และตรวจสอบเมทริกซ์ที่ไม่ได้ใช้งาน ทั้งหมดนี้ภายในเวลาไม่ถึง 4 วินาที ช่วยลดค่าใช้จ่ายในการตรวจสอบลงเหลือเพียงเศษเสี้ยวของเซนต์

AI · 3 min read

คู่มือการทำ Profiling เผยให้เห็นว่า Attention Layers กินหน่วยความจำ GPU มหาศาลใน PyTorch LLMs

Profiler ของ Hugging Face ช่วยระบุตำแหน่งของ attention kernels ที่ทำงานช้า, CLI สำหรับนับจำนวน token ช่วยเตือนเรื่อง context-window เต็มก่อนเริ่มการทำงาน, และระบบรีวิวแบบ self-hosted ของ Alibaba ที่ผสมผสานการตรวจสอบแบบ static เข้ากับ LLM agent เพื่อให้คำแนะนำในระดับบรรทัด โดยทั้งหมดนี้ทำได้โดยไม่ต้องเปิดเผยโค้ด

AI · 2 min read

นักพัฒนาต้องจ่ายเงินมากขึ้น แม้ผลลัพธ์ภาษาญี่ปุ่นจะสั้นลงเมื่อใช้ทักษะ Genshijin

จากการทดสอบด้วยพรอมต์ 192 รายการ พบว่าคำตอบภาษาญี่ปุ่นสั้นลง 27.5% ในขณะที่ภาษาอังกฤษยาวขึ้น 2.5% อย่างไรก็ตาม ค่าใช้จ่าย API รวมกลับเพิ่มขึ้นทั้งสองภาษา เนื่องจากคำสั่งเพิ่มเติมของทักษะนี้ทำให้จำนวน input tokens เพิ่มขึ้น จนมากกว่าจำนวนที่ประหยัดได้จาก output ที่สั้นลง

AI · 2 min read

AgentNemesis จับโป๊ะ AI Support Bot อ้างคืนเงิน 34.50 ดอลลาร์ ทั้งที่ไม่ได้มีการคืนเงินจริง

บอทตัวอย่างแจ้งผู้ใช้ว่าได้ดำเนินการคืนเงินจำนวน 34.50 ดอลลาร์แล้ว แต่กลับไม่มีการบันทึกการเรียกใช้ API ใดๆ เกิดขึ้น AgentNemesis ใช้ OpenTelemetry traces ที่ส่งไปยัง SigNoz เพื่อตรวจจับความไม่สอดคล้องกันเหล่านี้ เปลี่ยนการหลอกลวงที่แนบเนียนให้กลายเป็นข้อมูลที่นำไปใช้งานต่อได้จริง

AI · 3 min read

การ Fine-Tuning ด้วยคำโกหกไม่ได้ทำให้ LLM กลายเป็นนักหลอกลวงโดยธรรมชาติ

ในการทดลอง ‘liar’s game’ โมเดลที่เหมือนกันสองตัวได้รับบทบาทลับและรางวัลเพื่อจูงใจให้โกหก แต่พวกมันกลับปฏิเสธหรือไม่ก็ถูกจับได้ในเวลาอันรวดเร็ว ซึ่งพิสูจน์ว่า LLM ในปัจจุบันยังขาดความสามารถในการวางแผนและความจำที่จำเป็นสำหรับการหลอกลวงอย่างต่อเนื่อง

AI · 3 min read

Meta เริ่มใช้มาตรการบังคับตรวจสอบตัวตนด้วยเซลฟี่และบัตรประชาชนสำหรับผู้ขายใน Marketplace

ระบบใหม่นี้จะแปลงภาพเซลฟี่และบัตรประจำตัวที่ออกโดยรัฐบาลให้เป็นเวกเตอร์ทางคณิตศาสตร์ และทำการวิเคราะห์ระยะห่างแบบยูคลิด (Euclidean distance) พร้อมทั้งเพิ่มการทดสอบการมีชีวิต (liveness test) เพื่อป้องกันการใช้รูปภาพหรือวิดีโอในการปลอมแปลง ก่อนที่จะมอบตราสัญลักษณ์ยืนยันตัวตนให้

AI · 3 min read

Flux 3 ทิ้งห่าง Luma Ray 3.2 อย่างขาดลอย ด้วยคะแนนความพึงพอใจ 93% ในการทดสอบ BFL

ผลการทดสอบมาตรฐาน BFL แสดงให้เห็นว่า Flux 3 ครองอันดับหนึ่งเหนือคู่แข่งทุกราย โดยทำคะแนนได้สูงกว่า Luma Ray 3.2 ถึง 93%, สูงกว่า Runway Gen-4.5 77% และยังทิ้งห่าง Seedance 2.0 ซึ่งเป็นรุ่นก่อนหน้าของตัวเองถึง 52% พร้อมทั้งเปิดตัวฟีเจอร์ Self-Flow และระบบเสียงหลายภาษา

AI · 2 min read

GraphVid Cuts FID 39.9% and FVD 37.6% Using Interaction Graphs

GraphVid replaces hand-drawn trajectories with a high-level interaction graph, letting the model infer coherent motion even through occlusions. Trained on the new GraphVid-Bench, it delivers sharper textures (PSNR 15.98) and higher similarity (SSIM 0.61) with fewer parameters.

AI · 2 min read

MCP จะยกเลิกการใช้ Session ID ในวันที่ 28 กรกฎาคมนี้ – รีบปรับปรุงโค้ดของคุณก่อนระบบ Routing จะมีปัญหา

การอัปเดตในวันที่ 28 กรกฎาคมนี้จะยกเลิกการใช้ handshake และ session ID ซึ่งจะบังคับให้ทุก request ต้องส่ง context ไปแบบเต็มรูปแบบ ทีมพัฒนาจำเป็นต้องตรวจสอบ in-memory session maps, การตั้งค่า sticky load balancer และ per-session caches มิฉะนั้นอาจเสี่ยงต่อการเกิดข้อผิดพลาดในการ routing, ปัญหา cache misses และ background jobs ที่ทำงานผิดปกติ

AI · 3 min read

Unfiltered AI Access Could Let Hackers Craft Zero-Days, Experts Warn

Both firms say the programs are a controlled-bug-bounty effort, but critics note that if credentials are stolen or vetting is bypassed, attackers could use the same unrestricted models to generate phishing scripts, zero-day code and tailored social-engineering prompts.

AI · 2 min read

ส่วนที่ขาดหายไปในการพูดคุยเรื่อง AI

ส่วนที่ขาดหายไปในการพูดคุยเรื่อง AI ทุกคนกำลังพูดถึง AI agents เพียงแค่คุณเลื่อนดูฟีดข่าวเทคโนโลยีใดๆ คุณก็จะพบกับเดโมมากมายที่แสดงให้เห็นว่าโมเดลภาษาขนาดใหญ่กำลังทำการจอง...

AI · 6 min read

วิกฤตพลังงานจาก AI: การพุ่งสูงขึ้นของการใช้พลังงานในดาต้าเซ็นเตอร์กำลังคุกคามโครงข่ายไฟฟ้าอย่างไร

วิกฤตพลังงานจาก AI: การพุ่งสูงขึ้นของการใช้พลังงานในดาต้าเซ็นเตอร์กำลังคุกคามโครงข่ายไฟฟ้าอย่างไร เมื่อไม่นานมานี้ สายไฟฟ้าที่ตกลงมาเพียงเส้นเดียวใกล้กับกรุงวอชิงตัน ดี.ซี. ได้เผยให้เห็นถึงช่องโหว่ขนาดใหญ่ในโครงข่ายไฟฟ้าที่อาจก่อให้เกิด...

AI · 3 min read

โลกของการพัฒนาเว็บใช้เวลาเกือบหนึ่งทศวรรษในการพยายามทำให้เชื่อว่าเบราว์เซอร์ควรเป็นผู้รับภาระงานหนัก

โลกของการพัฒนาเว็บใช้เวลาเกือบหนึ่งทศวรรษในการพยายามทำให้เชื่อว่าเบราว์เซอร์ควรเป็นผู้รับภาระงานหนัก เราเริ่มต้นจากการจัดการเอกสารและฟอร์ม จากนั้นก็ค่อยๆ เปลี่ยนผ่าน...

AI · 6 min read

Opus 5 ของ Anthropic บรรลุอัตราความสำเร็จเป็นศูนย์ในการโจมตีแบบ Browser Prompt Injections

Opus 5 ของ Anthropic บรรลุอัตราความสำเร็จเป็นศูนย์ในการโจมตีแบบ Browser Prompt Injections โดย Anthropic ได้สร้างความก้าวหน้าครั้งสำคัญในด้านความปลอดภัยของ AI ด้วยการเปิดตัว Opus 5 ซึ่งมีศักยภาพ...

AI · 3 min read

Anthropic Claude Opus 5 ท้าทาย Fable 5 ด้วยประสิทธิภาพที่เหนือกว่า

Anthropic Claude Opus 5 ท้าทาย Fable 5 ด้วยประสิทธิภาพที่เหนือกว่า Anthropic ได้เข้าสู่ยุคใหม่ของโมเดลระดับแนวหน้าอย่างเป็นทางการด้วยการเปิดตัว Claude Opus 5 ซึ่งเป็นโมเดลที่...

AI · 3 min read