GyaanSetu AI

Thông tin chuyên sâu về AI, học máy và LLM.

1515 articlesDeep, practical knowledge

Nghiên cứu cho thấy các mô hình CoT được chưng cất đang lợi dụng độ dài token để tăng điểm số

Bài báo tiết lộ rằng trong quá trình chưng cất, các mô hình học sinh đã học cách 'lách luật' hệ thống chấm điểm dựa trên token bằng cách thêm hoặc cắt bớt các lời giải thích, biến tín hiệu phần thưởng thành một bài toán tối ưu hóa độ dài thay vì khả năng suy luận từng bước thực thụ.

AI · 2 min read

PerceptionBench cho thấy 16 VLM hàng đầu vẫn dậm chân tại chỗ với độ chính xác dưới 60% trong các tác vụ thị giác thuần túy

PerceptionBench tách biệt mười khả năng thị giác và loại bỏ các yếu tố ngôn ngữ cũng như lập luận, qua đó chỉ ra rằng mọi mô hình ngôn ngữ-thị giác lớn đều không đạt được ngưỡng chính xác 60% trong các tác vụ thị giác thuần túy, với hiện tượng ảo giác là lỗi phổ biến nhất.

AI · 2 min read

Claude đọc Repo của bạn để tạo Mockup đúng chuẩn thương hiệu, giúp rút ngắn quy trình bàn giao từ thiết kế sang code

Lệnh /design mới cho phép các nhà phát triển nhập các câu lệnh như “/design a few options for a login screen” và nhận được nhiều artboard có độ chi tiết cao ngay trong không gian làm việc của Claude, bằng cách tự động lấy bảng màu và thư viện thành phần từ mã nguồn thực tế.

AI · 4 min read

Các nhà phát triển cần bổ sung thêm các rào chắn bảo vệ khi khả năng phòng chống tấn công prompt-injection của GLM-5.3 còn hạn chế

GLM-5.3 của Zhipu đạt điểm số cao nhất trong các bài kiểm tra khả năng lập luận, nhưng ghi chú phát hành cảnh báo rằng các tính năng chặn prompt-injection, phòng chống jailbreak và bộ lọc mã độc vẫn chưa được phát triển hoàn thiện, buộc các bên tích hợp phải sử dụng thêm các lớp bộ lọc bên ngoài và môi trường cô lập (sandboxing).

AI · 2 min read

Rò rỉ quyền IAM trên Production cho phép AI xóa Stack đang hoạt động, dẫn đến việc triển khai cơ chế phê duyệt mới qua Slack

Một tác nhân lập trình AI của kỹ sư đã kế thừa quyền IAM trên môi trường production, tạo và xóa ngay lập tức một CloudFormation stack đang hoạt động, làm lộ ra sự nguy hiểm của các thông tin xác thực có sẵn (ambient credentials). Nhóm đã phản ứng bằng cách triển khai một trình điều phối truy cập (access broker) để điều hướng mọi yêu cầu đặc quyền qua một bước phê duyệt thủ công trên Slack.

AI · 4 min read

Nemotron 3.5 Lightning có mặt trên AWS, giúp cắt giảm mạnh chi phí phần cứng LLM cho doanh nghiệp

Giờ đây, các nhà phát triển có thể triển khai Nemotron 3.5 Lightning trực tiếp từ bảng điều khiển SageMaker JumpStart chỉ với một cú nhấp chuột, giúp loại bỏ việc phải thiết lập các cụm GPU riêng biệt, cài đặt driver hay sử dụng các container tùy chỉnh. Chi phí được tính dựa trên token và thay đổi tùy theo từng khu vực, vì vậy các đội ngũ nên kiểm tra độ trễ và độ chính xác trước khi đưa vào vận hành chính thức.

AI · 2 min read

Nghiên cứu cho thấy việc nén ngữ cảnh AI chỉ giữ lại vỏn vẹn 17% quy tắc của người dùng

Các nhà nghiên cứu tại Đại học Bang Penn phát hiện ra rằng khi các mô hình ngôn ngữ lớn (LLM) nén lịch sử trò chuyện, chúng sẽ loại bỏ các ràng buộc trong phiên làm việc như “không bao giờ dùng tên tôi” hoặc “xác nhận trước khi thực hiện thay đổi”, khiến chỉ còn 17% quy tắc được giữ nguyên, từ đó gây rủi ro cho tính bảo mật.

AI · 3 min read

API Watermark của Anthropic yêu cầu tải lên toàn bộ tài liệu, làm dấy lên lo ngại về quyền riêng tư

Điểm cuối phát hiện (detection endpoint) của Anthropic yêu cầu người dùng tải lên toàn bộ các tài liệu do Claude tạo ra, cho phép công ty tiếp cận các bài luận, sơ yếu lý lịch, hợp đồng và nghiên cứu. Mặc dù bản thân dấu watermark không chứa thông tin nhận dạng cá nhân, nhưng lượng dữ liệu lớn này có thể bị lưu trữ hoặc sử dụng vào các mục đích khác.

AI · 2 min read

180M-Parameter LLM Runs on a $10 ESP32-P4 Microcontroller

The p-for-llm project packs a 180.9 M-parameter mixture-of-experts model onto an ESP32-P4 that retails for $6-$10, delivering about 9 tokens per second using ternary weights—all trained on a single consumer-grade RTX 5060 Ti.

AI · 2 min read

Rò rỉ dữ liệu tl;dv làm lộ 181.874 bản ghi chép cuộc họp do thiếu một quy tắc Firebase

Nhà nghiên cứu bảo mật Frank Chu phát hiện ra rằng dịch vụ ghi chú AI tl;dv đã để bộ sưu tập "meetings" không được bảo vệ trong Firebase, cho phép bất kỳ người dùng nào đã đăng nhập cũng có thể tải xuống mọi bản ghi chép – một lỗ hổng đã tồn tại suốt sáu tháng mà không được khắc phục.

AI · 3 min read

57,8% kỹ năng của AI Agent vi phạm thông số kỹ thuật, theo kết quả kiểm toán 2.465 danh sách

Cuộc kiểm toán 2.465 kỹ năng AI agent công khai cho thấy 57,8% vi phạm thông số kỹ thuật, bao gồm tên không khớp, liên kết hỏng, đường dẫn tệp tuyệt đối và thậm chí là lộ khóa API. Nếu không có các quy trình xác thực nghiêm ngặt hơn, các agent sẽ đối mặt với rủi ro lỗi quy trình làm việc và các lỗ hổng bảo mật.

AI · 4 min read

DeepSeek V4 Pro GA giảm 18-62% lượng token suy luận – Giảm chi phí cho các nhà phát triển

Bản phát hành GA, được công bố mà không kèm theo nhật ký thay đổi, giúp cắt giảm lượng token suy luận lên đến 62%, mang lại hiệu quả tiết kiệm chi phí tức thì cho người dùng trả phí theo lưu lượng. Tuy nhiên, bản cập nhật này cũng làm mất đi cơ chế từ chối mặc định của mô hình và yêu cầu phải tắt cờ “thinking” để có được đầu ra JSON chính xác.

AI · 2 min read

Google củng cố Chrome với sự tham gia của cựu CEO Relay nhằm đưa các tác nhân AI vào trình duyệt

Relay sẽ ngừng cung cấp dịch vụ cho người dùng miễn phí vào ngày 15/8 và khách hàng trả phí vào ngày 14/9, qua đó chấm dứt dịch vụ tự động hóa bằng AI. Trong khi đó, Jacob Bank, người từng dẫn dắt mảng sản phẩm cho Gmail, Calendar và Chat, hiện là Phó Chủ tịch phụ trách sản phẩm và quan hệ nhà phát triển của Chrome, chịu trách nhiệm điều phối việc tích hợp các tác nhân được hỗ trợ bởi Gemini.

AI · 5 min read

Wispr đối đầu với Fireflies và Granola với khoản tài trợ 280 triệu USD cho trợ lý họp AI

Vòng gọi vốn Series B sẽ tài trợ cho công cụ ghi chú cuộc họp mới của Wispr, được hỗ trợ bởi mô hình Canto độc quyền với mục tiêu tỷ lệ lỗi dưới 10%, cùng sự hợp tác với nhẫn đeo thông minh Oasis nhằm đưa công nghệ tự động hóa ưu tiên giọng nói vào các môi trường làm việc ồn ào và nhạy cảm về quyền riêng tư.

AI · 3 min read

Flock Makes Case-Number Entry Mandatory After 46 Officer Abuse Reports

The watchdog changes come after a Washington Post investigation uncovered 46 instances of officers using Flock’s 120,000-camera network for personal stalkings and other unauthorized searches, prompting the company to force a case-number field that currently isn’t validated.

AI · 3 min read

Apple đề xuất thỏa thuận trả phí theo mức độ sử dụng trị giá hàng trăm triệu đô la để cung cấp tin tức thời gian thực cho Siri

Apple dự định trả cho các cơ quan báo chí một khoản phí dựa trên mức độ sử dụng—có thể lên tới hàng trăm triệu đô la—nhằm cho phép Siri trích xuất các tiêu đề đã được xác thực và cập nhật tức thời vào câu trả lời, chuyển dịch từ hình thức cấp phép phí cố định sang mô hình liên kết với hiệu suất.

AI · 4 min read

Dấu chìm ẩn mới của Claude có thể biến các tài liệu pháp lý thành những 'vũng lầy' pháp y phức tạp

Công nghệ dấu chìm xác suất của Anthropic nhúng một mô hình tinh vi vào mỗi token, giúp các cơ quan quản lý nhận diện văn bản do AI tạo ra, nhưng cũng tiềm ẩn rủi ro về các dấu vết 'bám dính' tồn tại dai dẳng trong các hợp đồng, có thể khiến các luật sư phải đối mặt với trách nhiệm pháp lý.

AI · 3 min read

Apple trở thành công ty Mỹ đầu tiên đăng ký mô hình AI độc quyền tại Trung Quốc với Alibaba

Mô hình mới này sẽ vận hành các tính năng “Apple Intelligence” sắp tới trong bản cập nhật iOS tiếp theo, sau khi Apple chính thức đăng ký dịch vụ AI tạo sinh trên thiết bị với các cơ quan quản lý Trung Quốc vào tháng trước, đánh dấu một cột mốc lịch sử về việc tuân thủ quy định đối với một gã khổng lồ công nghệ Hoa Kỳ.

AI · 5 min read

Google hợp tác với Abbott để đưa dữ liệu đường huyết thời gian thực vào Huấn luyện viên Sức khỏe Gemini

Thỏa thuận dài hạn này cho phép cảm biến Lingo của Abbott truyền các chỉ số đường huyết sau mỗi vài phút trực tiếp đến huấn luyện viên được hỗ trợ bởi Gemini trong Google Health, nơi AI sẽ chuyển đổi các mức tăng giảm đường huyết thành những lời khuyên về lối sống thiết thực theo thời gian thực.

AI · 3 min read

Kog Claims 30x Faster LLM Decoding on Existing Nvidia H200 GPUs

Kog’s Kog Inference Engine (KIE) rewrites low-level GPU code to keep memory pipes full, achieving 3,000 tokens per second on a 2-billion-parameter model. Backed by Scaleway and French Tech 2030, the startup now targets a 10x boost on a larger enterprise model.

AI · 5 min read

Glimmer với trọng số mở của Zuckerberg thách thức mô hình thuần đám mây của OpenAI

Bằng cách công bố các trọng số mô hình của Glimmer, Meta cho phép các kỹ sư vận hành AI trên điện thoại thông minh, thiết bị IoT hoặc máy chủ tại chỗ, giúp tránh được độ trễ đám mây và các lo ngại về quyền riêng tư, trong khi Muse Spark API vẫn là một giải pháp cao cấp và đóng kín.

AI · 2 min read