GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Anthropic รายได้ในอินเดียพุ่งขึ้นสองเท่าตั้งแต่เดือนตุลาคม 2025 พร้อมเปิดสำนักงานในเบงกาลูรู

Anthropic เปิดสำนักงานในเบงกาลูรู หลังอินเดียก้าวขึ้นเป็นตลาดอันดับ 2 ของ Claude โดย Anthropic กำลังเปิดสำนักงานแห่งใหม่ในเบงกาลูรู ซึ่งเป็นสำนักงานแห่งที่สองในภูมิภาคเอเชียแปซิฟิก แห่งแรกของพวกเขาคือ...

AI · 1 min read

Distilled CoT Models Exploit Token Length to Boost Scores, Study Finds

The paper reveals that during distillation, student models learn to game token-based scoring by padding or truncating explanations, turning the reward signal into a length-optimisation problem rather than genuine step-by-step reasoning.

AI · 2 min read

PerceptionBench พบว่า VLM ระดับท็อป 16 รุ่น มีความแม่นยำไม่ถึง 60% ในงานด้านการมองเห็นเพียงอย่างเดียว

PerceptionBench แยกแยะความสามารถด้านการมองเห็น 10 ประการ โดยตัดปัจจัยด้านภาษาและการใช้เหตุผลออก เพื่อเผยให้เห็นว่าโมเดล vision-language หลักทุกรุ่นไม่สามารถทำความแม่นยำได้ถึงเกณฑ์ 60% ในงานด้านการมองเห็นเพียงอย่างเดียว โดยมีอาการหลอน (hallucinations) เป็นข้อผิดพลาดที่พบได้บ่อยที่สุด

AI · 2 min read

Claude อ่าน Repo ของคุณเพื่อสร้าง Mockup ที่ตรงตามแบรนด์ ช่วยลดขั้นตอนการส่งต่องานระหว่างดีไซน์และโค้ด

คำสั่ง /design ใหม่ช่วยให้นักพัฒนาสามารถพิมพ์ prompt เช่น “/design ตัวเลือกสักสองสามแบบสำหรับหน้าจอ login” และรับ artboard ความละเอียดสูงหลายรูปแบบได้โดยตรงในพื้นที่ทำงานของ Claude โดยระบบจะดึงพาเลตสีและไลบรารีคอมโพเนนต์มาจากโค้ดจริงที่ใช้งานอยู่

AI · 4 min read

นักพัฒนาต้องเพิ่มมาตรการป้องกันเพิ่มเติม เนื่องจากระบบป้องกัน Prompt-Injection ของ GLM-5.3 ยังตามไม่ทัน

แม้ GLM-5.3 ของ Zhipu จะทำคะแนนได้สูงสุดในการทดสอบด้านการใช้เหตุผล แต่บันทึกการเปิดตัวได้เตือนว่า ระบบป้องกัน Prompt-Injection, การป้องกันการ Jailbreak และตัวกรองโค้ดอันตรายยังไม่ได้รับการพัฒนาอย่างเต็มที่ ส่งผลให้ผู้ที่นำไปใช้งานจำเป็นต้องเพิ่มตัวกรองภายนอกและระบบ Sandboxing เข้าไปอีกชั้น

AI · 2 min read

การรั่วไหลของ IAM Role ใน Production ทำให้ AI ลบ Live Stack ได้ นำไปสู่การเพิ่มระบบอนุมัติผ่าน Slack

เอเจนต์เขียนโค้ด AI ของวิศวกรคนหนึ่งได้รับสิทธิ์ IAM Role ในระดับ Production มาโดยไม่ตั้งใจ และได้สร้างพร้อมกับลบ CloudFormation Stack ที่ใช้งานจริงออกทันที ซึ่งเผยให้เห็นถึงอันตรายของ ambient credentials ทีมงานจึงตอบโต้ด้วยการติดตั้ง access broker ที่จะส่งทุกคำขอที่มีสิทธิ์สูง (privileged request) ไปยังขั้นตอนการอนุมัติโดยมนุษย์ผ่าน Slack

AI · 4 min read

Nemotron 3.5 Lightning เปิดตัวบน AWS ช่วยลดต้นทุนฮาร์ดแวร์ LLM สำหรับองค์กรอย่างมหาศาล

นักพัฒนาสามารถเริ่มใช้งาน Nemotron 3.5 Lightning ได้โดยตรงผ่านคอนโซล SageMaker JumpStart ด้วยการคลิกเพียงครั้งเดียว โดยไม่ต้องจัดการ GPU cluster, ติดตั้งไดรเวอร์ หรือใช้คอนเทนเนอร์แบบกำหนดเอง ทั้งนี้ การคิดราคาจะเป็นรูปแบบ Token-based ซึ่งแตกต่างกันไปในแต่ละภูมิภาค ดังนั้นทีมงานควรตรวจสอบค่าความหน่วง (latency) และความแม่นยำก่อนนำไปใช้งานจริง

AI · 2 min read

ผลการศึกษาพบว่า การบีบอัดบริบทของ AI เก็บรักษาคำสั่งของผู้ใช้ไว้เพียง 17% เท่านั้น

นักวิจัยจาก Penn State พบว่า เมื่อ LLM บีบอัดประวัติการสนทนา พวกมันจะละทิ้งข้อกำหนดในเซสชัน เช่น "ห้ามใช้ชื่อของฉัน" หรือ "ยืนยันก่อนทำการเปลี่ยนแปลง" โดยเหลือคำสั่งเหล่านี้ไว้เพียง 17% เท่านั้น ซึ่งอาจส่งผลกระทบต่อความปลอดภัย

AI · 3 min read

API ลายน้ำของ Anthropic บังคับให้อัปโหลดเอกสารทั้งฉบับ จุดชนวนความกังวลด้านความเป็นส่วนตัว

Endpoint สำหรับการตรวจจับของ Anthropic กำหนดให้ผู้ใช้ต้องอัปโหลดเอกสารทั้งหมดที่สร้างโดย Claude ซึ่งทำให้บริษัทสามารถเข้าถึงทั้งเรียงความ เรซูเม่ สัญญา และงานวิจัย แม้ว่าตัวลายน้ำเองจะไม่ใช่ข้อมูลที่ระบุตัวตนบุคคลได้ แต่ข้อมูลจำนวนมหาศาลเหล่านี้อาจถูกเก็บรักษาไว้หรือนำไปใช้ในวัตถุประสงค์อื่น

AI · 2 min read

180M-Parameter LLM Runs on a $10 ESP32-P4 Microcontroller

The p-for-llm project packs a 180.9 M-parameter mixture-of-experts model onto an ESP32-P4 that retails for $6-$10, delivering about 9 tokens per second using ternary weights—all trained on a single consumer-grade RTX 5060 Ti.

AI · 2 min read

ข้อมูลรั่วไหลจาก tl;dv เผยบทถอดความการประชุมกว่า 181,874 รายการ หลังพบข้อผิดพลาดในการตั้งค่ากฎ Firebase

Frank Chu นักวิจัยด้านความปลอดภัยพบว่า tl;dv บริการจดบันทึกด้วย AI ปล่อยให้คอลเลกชัน "meetings" ใน Firebase ไม่ได้รับการป้องกัน ทำให้ผู้ใช้ที่ล็อกอินอยู่สามารถดาวน์โหลดบทถอดความทั้งหมดได้ ซึ่งเป็นช่องโหว่ที่ไม่มีการแก้ไขนานถึง 6 เดือน

AI · 3 min read

ผลการตรวจสอบพบทักษะ AI Agent 57.8% ไม่เป็นไปตามข้อกำหนด จากการตรวจสอบทั้งหมด 2,465 รายการ

การตรวจสอบทักษะ AI Agent สาธารณะจำนวน 2,465 รายการ พบว่า 57.8% มีการละเมิดข้อกำหนด ซึ่งรวมถึงการตั้งชื่อไม่ตรงกัน, ลิงก์เสีย, การใช้เส้นทางไฟล์แบบสมบูรณ์ (absolute file paths) และแม้กระทั่งการเปิดเผย API key หากไม่มีกระบวนการตรวจสอบ (validation pipelines) ที่เข้มงวดกว่านี้ AI Agent อาจเสี่ยงต่อความล้มเหลวในเวิร์กโฟลว์และการรั่วไหลด้านความปลอดภัย

AI · 4 min read

DeepSeek V4 Pro GA Cuts Reasoning Tokens 18-62% – Lower Bills for Developers

The GA release, announced without a changelog, slashes reasoning-token usage by up to 62%, turning into immediate cost savings for metered users, but it also drops the model’s built-in refusal behavior and requires the “thinking” flag to be off for correct JSON output.

AI · 2 min read

Google เสริมทัพ Chrome ด้วยการดึงอดีต CEO จาก Relay เพื่อผลักดัน AI Agents เข้าสู่เบราว์เซอร์

Relay เตรียมยุติบริการ AI-automation โดยจะหยุดให้บริการแก่ผู้ใช้ฟรีในวันที่ 15 ส.ค. และลูกค้าแบบชำระเงินในวันที่ 14 ก.ย. ในขณะเดียวกัน Jacob Bank อดีตผู้ดูแลผลิตภัณฑ์ Gmail, Calendar และ Chat ได้ก้าวขึ้นมาดำรงตำแหน่ง VP ด้านผลิตภัณฑ์และความสัมพันธ์นักพัฒนาของ Chrome เพื่อนำทัพการผสานรวม AI Agent ที่ขับเคลื่อนด้วย Gemini

AI · 5 min read

Wispr เตรียมท้าชน Fireflies และ Granola ด้วยเงินทุน 280 ล้านดอลลาร์ เพื่อพัฒนาผู้ช่วยประชุม AI

การระดมทุนระดับ Series B นี้จะนำไปใช้สนับสนุนเครื่องมือจดบันทึกการประชุมตัวใหม่ของ Wispr ซึ่งขับเคลื่อนด้วยโมเดล Canto ที่เป็นกรรมสิทธิ์ของบริษัท โดยตั้งเป้าอัตราความผิดพลาดให้ต่ำกว่า 10% พร้อมทั้งสร้างความร่วมมือกับแหวนอัจฉริยะ Oasis เพื่อนำระบบอัตโนมัติที่เน้นการสั่งงานด้วยเสียงเข้าสู่สถานที่ทำงานที่มีเสียงรบกวนและต้องการความเป็นส่วนตัวสูง

AI · 3 min read

Flock กำหนดให้ต้องระบุเลขคดี หลังพบรายงานการใช้อำนาจในทางที่ผิดโดยเจ้าหน้าที่ 46 ราย

การเปลี่ยนแปลงเพื่อการควบคุมดูแลนี้เกิดขึ้นหลังจากการสืบสวนของ Washington Post เปิดเผยกรณีที่เจ้าหน้าที่ใช้เครือข่ายกล้อง 120,000 ตัวของ Flock เพื่อการสะกดรอยตามส่วนตัวและการค้นหาอื่นๆ โดยไม่ได้รับอนุญาตถึง 46 ครั้ง ซึ่งส่งผลให้บริษัทต้องบังคับให้มีการกรอกช่องเลขคดีที่ปัจจุบันยังไม่มีการตรวจสอบความถูกต้อง

AI · 3 min read

Apple เสนอข้อตกลงแบบจ่ายตามการใช้งานมูลค่าหลายร้อยล้านดอลลาร์ เพื่อป้อนข่าวแบบเรียลไทม์ให้ Siri

Apple วางแผนที่จะจ่ายค่าธรรมเนียมตามการใช้งานให้กับสำนักข่าวต่างๆ ซึ่งอาจมีมูลค่าสูงถึงหลายร้อยล้านดอลลาร์ เพื่อให้ Siri สามารถดึงพาดหัวข่าวที่ผ่านการตรวจสอบแล้วและเป็นปัจจุบันที่สุดมาใช้ในการตอบคำถาม โดยเปลี่ยนจากการซื้อลิขสิทธิ์แบบจ่ายคงที่ มาเป็นโมเดลที่ผูกกับประสิทธิภาพการใช้งาน

AI · 4 min read

ลายน้ำลับแบบใหม่ของ Claude อาจทำให้เอกสารทางกฎหมายกลายเป็นความยุ่งเหยิงทางนิติวิทยาศาสตร์

ลายน้ำแบบความน่าจะเป็นของ Anthropic จะฝังรูปแบบที่แนบเนียนลงในทุกโทเคน ช่วยให้หน่วยงานกำกับดูแลสามารถตรวจพบข้อความที่สร้างโดย AI ได้ แต่ก็มีความเสี่ยงที่จะเกิด "ลายน้ำที่ติดแน่น" ซึ่งตกค้างอยู่ในสัญญาและอาจทำให้ทนายความต้องเผชิญกับความรับผิดทางกฎหมาย

AI · 3 min read

Apple กลายเป็นบริษัทสหรัฐฯ แห่งแรกที่จดทะเบียนโมเดล AI ของตนเองในจีนร่วมกับ Alibaba

โมเดลใหม่นี้จะขับเคลื่อนฟีเจอร์ “Apple Intelligence” ที่กำลังจะมาถึงในการอัปเดต iOS ครั้งถัดไป หลังจากที่ Apple ได้จดทะเบียนบริการ Generative AI แบบประมวลผลบนอุปกรณ์กับหน่วยงานกำกับดูแลของจีนอย่างเป็นทางการเมื่อเดือนที่แล้ว ซึ่งถือเป็นก้าวสำคัญทางประวัติศาสตร์ในการปฏิบัติตามกฎระเบียบสำหรับยักษ์ใหญ่ด้านเทคโนโลยีของสหรัฐฯ

AI · 5 min read

Google จับมือ Abbott ส่งข้อมูลระดับน้ำตาลแบบเรียลไทม์เข้าสู่ Gemini Health Coach

ข้อตกลงระยะเวลาหลายปีนี้จะช่วยให้เซนเซอร์ Lingo ของ Abbott สามารถส่งข้อมูลระดับน้ำตาลได้ทุกๆ ไม่กี่นาทีเข้าสู่โค้ชที่ขับเคลื่อนด้วย Gemini ภายใน Google Health โดยตรง ซึ่ง AI จะเปลี่ยนข้อมูลการพุ่งขึ้นและลดลงของระดับน้ำตาลให้เป็นคำแนะนำในการปรับเปลี่ยนไลฟ์สไตล์ที่นำไปใช้ได้จริงแบบเรียลไทม์

AI · 3 min read

Kog Claims 30x Faster LLM Decoding on Existing Nvidia H200 GPUs

Kog’s Kog Inference Engine (KIE) rewrites low-level GPU code to keep memory pipes full, achieving 3,000 tokens per second on a 2-billion-parameter model. Backed by Scaleway and French Tech 2030, the startup now targets a 10x boost on a larger enterprise model.

AI · 5 min read