GyaanSetu AI

Thông tin chuyên sâu về AI, học máy và LLM.

1515 articlesDeep, practical knowledge

Cách chia tách khả năng suy luận của LLM thành bốn tác nhân giúp việc phân tích dữ liệu trở nên đáng tin cậy hơn

Quy trình làm việc mới này tách biệt vai trò của LLM chỉ để đưa ra quyết định, trong khi các kịch bản chạy trong môi trường sandbox có tính xác định sẽ đảm nhận mọi tính toán, giúp cung cấp các kết quả có thể kiểm chứng từng bước và giảm thiểu các số liệu sai lệch thường gặp khi thực hiện EDA chỉ bằng một câu lệnh duy nhất.

AI · 3 min read

Nghiên cứu từ MIT cho thấy các công cụ kiểm chứng thông tin bằng AI khiến người dùng kém khả năng phát hiện tin giả hơn

Trong một thí nghiệm kéo dài bốn tuần với 67 người tham gia, các nhà nghiên cứu MIT đã để một AI có độ chính xác cao đưa ra các phán quyết đúng/sai về các mẩu tin tức. Mặc dù AI này đúng trong hầu hết các trường hợp, nhưng những người dùng phụ thuộc vào nó đã bị giảm khả năng tự đánh giá thông tin sai lệch một cách rõ rệt khi không có sự hỗ trợ của AI.

AI · 2 min read

Hình ảnh vượt trội hơn văn bản trên Gemini: Toán học, các ký tự không thuộc hệ chữ Latinh và bảng biểu có chi phí thấp hơn

Gemini của Google tính token hình ảnh theo các ô 768 pixel, với mức phí 258 token cho mỗi ô. Bằng cách giữ hình ảnh trong phạm vi một ô—hoặc sử dụng chúng cho các dữ liệu dày đặc như phương trình, bảng biểu hoặc các ký tự không thuộc hệ chữ Latinh—các nhà phát triển thường có thể tiết kiệm chi phí hơn nhiều so với việc gửi cùng một thông tin dưới dạng văn bản.

AI · 3 min read

AWS ra mắt Bedrock AgentCore nhằm tiêu chuẩn hóa việc điều phối tác nhân AI tại Hội nghị Thượng đỉnh Bogotá

Tại Hội nghị Thượng đỉnh Bogotá, AWS đã công bố Bedrock AgentCore, một nền tảng thống nhất tích hợp khả năng điều phối, khả năng quan sát và các kiểm soát an toàn, cho phép các nhà phát triển triển khai nhanh các tác nhân AI chuyên dụng mà không cần xây dựng các hạ tầng kết nối tùy chỉnh.

AI · 4 min read

75% lượt thực hiện của Claude Code là để đọc

75% lượt thực hiện của Claude Code là để đọc. Hầu hết mọi người đều nghĩ rằng các tác nhân lập trình AI dành thời gian để viết mã. Tuy nhiên, dữ liệu mới cho thấy điều này là sai. Red Hat đã phân tích 219 phiên Claude Code thực tế. T…

AI · 3 min read

Prompt Caching của Claude gặp lỗi âm thầm

Prompt Caching của Claude gặp lỗi âm thầm. Tính năng prompt caching của Claude có thể đang gặp lỗi mà bạn không hề hay biết. Tôi đã thêm cache control vào một trình xử lý WhatsApp. Tôi đã theo dõi các bản ghi để...

AI · 3 min read

Tính năng Prompt-Caching của Claude Opus 5 giúp giảm 90% chi phí token cho chatbot sau lần gọi đầu tiên

Việc ghi cache mới có chi phí gấp 1,25 hoặc 2 lần giá cơ bản cho thời gian tồn tại (TTL) là 5 phút hoặc 1 giờ, nhưng mỗi lần truy cập sau đó chỉ tính phí 0,1 lần, giúp biến các cuộc hội thoại chuyên sâu thành một khoản chi phí phát sinh một lần nếu bạn nạp trước các ngữ cảnh không thay đổi.

AI · 3 min read

Kiểm duyệt bằng AI giúp lượng bài đăng của người dùng mới trên Reddit tăng vọt 22% mà không làm gia tăng spam

Trong các đợt thử nghiệm ban đầu tại các subreddit như r/technology, hệ thống kiểm duyệt bằng AI của Reddit đã thúc đẩy hoạt động của người dùng mới tăng 22%, trong khi vẫn giữ tỷ lệ spam và quấy rối bị gắn cờ ở mức ổn định, cho thấy mô hình này có thể hạ thấp rào cản gia nhập mà không làm ảnh hưởng đến sự an toàn.

AI · 2 min read

GraphRAG + Bộ nhớ bền vững giúp ngăn chatbot quên thông tin khi đóng tab

Bằng cách chuyển đổi văn bản được truy xuất thành một đồ thị các thực thể và mối quan hệ, GraphRAG cho phép các mô hình suy luận trên nhiều tài liệu, trong khi bộ nhớ ngữ cảnh ba tầng lưu trữ các cuộc hội thoại ngắn hạn, các dữ kiện người dùng dài hạn và dữ liệu được cắt tỉa có chọn lọc để duy trì thông tin khi làm mới trang hoặc mở tab mới.

AI · 3 min read

Bộ điều phối Agent của tôi đã 'đốt' hết 1-2 triệu USD tiền token Opus cho mỗi tác vụ

Các tác nhân con của bộ điều phối đã kế thừa các thiết lập từ tác nhân cha, mặc định sử dụng gói Opus đắt đỏ, ghi đè lại bộ nhớ đệm (cache) sau mỗi lần gọi và chạy các vòng lặp vô tận cho đến khi được người kiểm duyệt phê duyệt, khiến một công việc đơn giản trở thành một khoản chi phí lên tới hàng triệu token.

AI · 2 min read

DiffusionGemma đạt tốc độ 1.500 token/giây trên một H100, vượt xa mức 303 của Gemma 4

DiffusionGemma thay thế vòng lặp token từ trái sang phải truyền thống bằng một khối khuếch tán 256 token, giúp khử nhiễu toàn bộ khối dữ liệu một cách song song. Cách tiếp cận này giúp giảm độ trễ cho các tác nhân AI thời gian thực, dù điểm số trên thang đo AIME giảm từ 88,3 xuống 69,1 và gặp khó khăn với các câu lệnh ngắn.

AI · 3 min read

Microsoft cho biết cần từ 26 đến 60 tuần kỹ sư để xây dựng các tác nhân AI sẵn sàng thực thi

Bản hướng dẫn mới phác thảo bảy trụ cột kiến trúc—quyền hạn, ranh giới, lược đồ, phát hiện lỗi, trạng thái, hoàn tác và khả năng kiểm chứng—cần phải được xây dựng lại từ đầu trước khi bất kỳ tác nhân tự hành nào có thể được phát hành, đồng thời cảnh báo rằng các tác vụ có giá trị thấp sẽ không xứng đáng với công sức bỏ ra.

AI · 3 min read

AI của Grab giúp cắt giảm 30% thời gian giao hàng và thúc đẩy lợi nhuận hoạt động tăng 186% lên 19 triệu USD

Bộ công cụ AI của Grab—bao gồm định tuyến Turbo Mode, Ghép cặp Dự đoán (Predictive Matching) và trợ lý người bán Mai—giúp rút ngắn tới 1/3 thời gian giao hàng, tăng thu nhập của tài xế thêm 23% và doanh số nhà hàng thêm 15%, trong khi lợi nhuận hoạt động của nền tảng tăng vọt 186% lên mức 19 triệu USD.

AI · 2 min read

Phân tầng Claude giúp giảm 35% chi phí API và cắt giảm độ trễ xuống còn 27 giây

Tác giả đã xây dựng một bảng tra cứu tĩnh để phân loại các tác vụ dựa trên mức độ mơ hồ sang các mô hình Haiku, Sonnet hoặc Opus, đồng thời thêm quy tắc leo thang sau hai lần thất bại. Trong bốn tuần, hệ thống đã duy trì được chất lượng trong khi giảm chi phí API xuống còn 65% so với ban đầu và cắt giảm thời gian xử lý trung vị từ 42 giây xuống còn 27 giây.

AI · 3 min read

Lỗ hổng RCE FaceHugger vượt qua cơ chế kiểm soát tin cậy của Diffusers, cho phép thực thi mã khi tải mô hình

Lỗ hổng FaceHugger khai thác tình trạng tranh chấp (race condition) trong quá trình tải hai giai đoạn, cho phép mã độc được chèn vào yêu cầu thứ hai thực thi ngay cả khi `trust_remote_code` đã bị vô hiệu hóa, gây rủi ro cho các tác vụ CI/CD, container và các dịch vụ suy luận doanh nghiệp.

AI · 2 min read

Một bộ đếm cổng duy nhất đã che giấu sự cố ngừng hoạt động AI kéo dài cả ngày trong môi trường vận hành

Tính năng AI của tôi đã ngừng hoạt động suốt một ngày. Thế nhưng, các chỉ số đo lường lại cho thấy nó vẫn đang hoạt động bình thường. Hôm qua, hệ thống drone của tôi đã ghi nhận bốn giải thích từ AI, nhưng một cổng kiểm soát an toàn đã từ chối cả bốn. Tôi cảm thấy an tâm về điều đó...

AI · 2 min read

Các máy chủ MCP gói miễn phí siêu nhỏ trả về Markdown với mức CPU chỉ 1-2 ms trên Cloudflare

Kết quả thử nghiệm của chúng tôi cho thấy một máy chủ MCP chỉ đọc xử lý các lệnh gọi list và get_article chỉ tiêu tốn 0-2 ms CPU mỗi yêu cầu, nằm dưới mức giới hạn của gói miễn phí Cloudflare, nhưng bất kỳ hoạt động phân tích dữ liệu tức thời nào cũng sẽ nhanh chóng chạm ngưỡng 10 ms.

AI · 3 min read

Hermes Agent giảm thiểu rủi ro rò rỉ dữ liệu bằng cách thực thi các công cụ AI tại chỗ

Hermes Agent thu hẹp khoảng cách giữa chatbot và các trợ lý có khả năng lập trình bằng cách cho phép các nhà phát triển tích hợp các lệnh shell, I/O tệp và các dịch vụ tùy chỉnh, đồng thời lưu trữ ngữ cảnh qua các phiên làm việc—tất cả đều được thực hiện trên phần cứng riêng của họ.

AI · 3 min read

Nhóm vệ tinh thử nghiệm đầu tiên dự kiến ra mắt vào cuối năm 2027 để cung cấp tốc độ tải xuống lên tới 1 Tbps

Chòm sao vệ tinh quỹ đạo thấp gồm 20 vệ tinh của EON sẽ sử dụng laser công suất cao và các trạm mặt đất có khả năng thích ứng với nhiều điều kiện thời tiết khác nhau để cung cấp các kết nối quy mô terabit trên các tuyến đường quan trọng như Pháp-Australia, nhằm cung cấp dung lượng chuyên dụng với độ trễ thấp cho các khách hàng sử dụng nhiều ứng dụng AI.

AI · 4 min read