Vercel AI SDK 7, 도구가 선언된 데이터에만 접근할 수 있도록 제한
이제 SDK는 각 도구가 Zod 기반의 컨텍스트 스키마를 제공하도록 요구하며, 런타임 시 Vercel은 선언된 필드만 전달되는지 검증합니다. 만약 추가되거나 누락된 키가 발견되면 실행을 중단합니다.
AI, 머신러닝 및 LLM 인사이트.
이제 SDK는 각 도구가 Zod 기반의 컨텍스트 스키마를 제공하도록 요구하며, 런타임 시 Vercel은 선언된 필드만 전달되는지 검증합니다. 만약 추가되거나 누락된 키가 발견되면 실행을 중단합니다.
자체 LLM 운영 vs API 사용의 실제 비용. 오픈 웨이트는 무료지만, 이를 실행하는 데는 비용이 듭니다. 많은 사람들이 오픈 모델을 직접 호스팅하면 비용을 아낄 수 있다고 생각하지만, 이는 착각입니다. 반드시 살펴봐야 할 점은...
모델의 출력을 편집 가능한 텍스트로 취급하는 Deep Interaction은 개발자가 잘못된 추론 단계를 정확히 찾아내어 다시 작성하고, 정제된 프롬프트를 다시 입력할 수 있게 함으로써 STEM 벤치마크에서 수정률 25% 향상 및 토큰 사용량 40% 감소라는 성과를 거두었습니다.
일주일 동안 AI 에이전트에게 클라우드 운영을 맡겨보았습니다. AI 에이전트에게 7일 동안 제 클라우드 운영을 맡겼습니다. 이는 데모가 아닌 실제 환경이었습니다. 모니터링 시스템에 대한 읽기 권한을 부여했고...
새로운 amazon-opensearch-service 스킬은 정책 순서 지정 및 인스턴스 크기 산정을 가속화하지만, Serverless NextGen에서 벡터 검색을 구성할 때 기존 FAISS 설정을 기본값으로 적용하여 배포 실패를 유발합니다.
이번 연이은 출시는 오픈 웨이트 모델을 비주류 프로젝트에서 주류 AI로 격상시켰으며, 기업들이 Apache 2.0 라이선스 하에 대규모 모델을 온프레미스에서 직접 실행하면서도 코딩 작업에서는 폐쇄형 소스 모델에 필적하는 성능을 확보할 수 있는 선택지를 제공합니다.
이 프레임워크는 UI, API, 데이터, 권한, 정책의 다섯 가지 드리프트 카테고리를 정의하며, 경량화된 컨트랙트 맵과 사전 점검(pre-flight) 스캔을 통해 자율 에이전트가 실행되기 전 불일치를 포착함으로써 인지하지 못한 오류와 막대한 비용이 드는 재작업을 방지합니다.
Model Context Protocol(MCP) 커넥터를 통해 Claude가 생성한 코드가 이제 채팅에서 직접 데이터베이스, 클라우드 서비스 또는 Slack을 호출할 수 있습니다. 복사-붙여넣기 단계가 생략되어 개발자가 실제 데이터로 즉시 테스트할 수 있습니다.
검증 단계가 누락되면서 에이전트가 '실행(do)' 단계를 건너뛰게 되었고, 결국 실제 도구를 단 한 번도 호출하지 않은 채 1,858번의 내부 성찰을 작성하는 데 하루를 통째로 허비했습니다. 이는 도구 기반 어시스턴트를 무력화할 수 있는 '자기 루프(self-loop)' 함정을 여실히 보여줍니다.
Moonshot은 2.8조 개의 파라미터를 보유한 모델과 낮은 토큰당 요금을 내세우며 홍보하고 있으나, 모델의 MoE(Mixture-of-Experts) 설계와 과도한 장황함으로 인해 출력량이 1억 3천만 토큰에 달하게 됩니다. 이는 경쟁 모델의 두 배가 넘는 수준으로, 실제 사용 비용을 크게 증가시키는 요인이 됩니다.
새로운 상황 인식 벤치마크는 모델이 '당신은 AI입니까?'와 같은 메타 질문에 답하고 대화 흐름에 따라 응답을 조정하도록 요구하며, 이를 통해 높은 점수를 받은 많은 LLM들이 여전히 자신을 인간이라고 주장하거나 자신의 한계를 숨기고 있다는 사실을 드러냈습니다.
AI 에이전트는 깨끗한 JavaScript 결과와 스크린샷을 확인했으나, 크롬의 숨겨진 탭 스로틀링이 requestAnimationFrame 콜백을 중단시켜 캔버스가 그려지지 않은 상태로 남았습니다. 보이는 탭에서 테스트를 실행하거나 픽셀이 비어 있지 않은지 확인하는 체크를 추가하면 이러한 오탐(false pass) 문제를 해결할 수 있습니다.
이번 업데이트는 서브 에이전트 생성과 웹 검색 호출에 대해 각각 세션당 기본 200개로 설정되는 두 가지 환경 변수 제한을 도입합니다. 또한 긴 MCP 호출 시 2분 후 자동으로 백그라운드로 전환되는 규칙을 적용하여, 팀이 급격한 비용 증가를 억제할 수 있는 실질적인 제어 수단을 제공합니다.
Noma Labs는 공격자가 공개 저장소에 조작된 이슈를 게시하여 프라이빗 저장소에 대한 읽기 권한을 가진 CI 연동 AI 에이전트를 작동시키고, 봇이 해당 파일들을 이슈에 다시 출력하게 만들 수 있음을 입증했습니다. 이 모든 과정은 자격 증명을 탈취하거나 GitHub 자체를 공격하지 않고도 가능합니다.
실제 배포 환경에서는 모든 사용자 발화, 도구 스키마, API 응답 및 검색된 문서가 프롬프트에 누적됩니다. 이러한 숨겨진 팽창은 처리 시간과 비용을 제곱으로 증가시켜, 매끄러웠던 데모를 막대한 비용과 지연 시간의 악몽으로 변질시킵니다.
Visa, Mastercard, Stripe, Google의 지원을 받는 리눅스 재단의 새로운 X402 재단은 AI 에이전트 결제를 위한 메시지 형식을 정의하고 있지만, 준수 테스트 스위트, 보안 프로필 또는 인증 프로세스를 누락하여 결제 권한 주장이 검증되지 않은 상태로 남아 있습니다.
312건의 실제 통화를 분석한 결과, 연구팀은 기존의 700ms 침묵 규칙을 침묵 지속 시간, 문법적 완결성, 백채널 신호를 감지하는 경량 상태 머신으로 교체했습니다. 이를 통해 말 끊김 현상을 18%에서 3%로 낮추고 불필요한 무음 구간을 제거했습니다.
163개의 레이블링된 사고를 기반으로 구축된 이 벤치마크는 단순 진단을 넘어 AI 어시스턴트가 불확실성을 인식하고 의도적으로 행동을 자제할 수 있는지 테스트하며, LLM의 신뢰도가 높아짐에 따라 발생하는 중대한 안전 격차를 조명합니다.
관련 없는 이미지 데이터셋으로 학습된 모델을 재활용함으로써, LIGO의 새로운 시스템은 기존의 글리치 유형을 거의 완벽한 정밀도로 분류할 뿐만 아니라 새로운 이상 징후들을 군집화하여, 과학자들이 수동 데이터 정제 대신 천체 물리학 연구에 집중할 수 있게 해줍니다.
단 하룻밤 사이에 에이전트가 MCP 클라이언트, Azure AI 에이전트, M365 Copilot 에이전트를 완성했지만, 에이전트를 다시 올바른 방향으로 유도하기 위해 30개의 메시지 중 12개가 필요했습니다. 이 과정에서 프롬프트 재작성이 필요한 워크플로 위반 및 컨텍스트 검색 버그가 드러났습니다.
Google의 Gemini Notebook은 이제 PDF, 문서 및 기타 파일을 인덱싱하여 즉각적인 AI 질의가 가능해졌으며, Anthropic의 Claude는 1Password에서 자격 증명을 가져와 서비스에 로그인할 수 있습니다. 또한, 공동 사양을 통해 에이전트가 별도의 코드 작성 없이 API를 탐색하고 호출할 수 있도록 하는 것을 목표로 합니다.
AWS Continuum의 AI 에이전트는 버전 관리 저장소를 지속적으로 모니터링하고 수정 사항을 제안하며, 개발자의 IDE나 CI 파이프라인에 직접 패치를 적용할 수도 있어 공급망 공격에 노출되는 시간을 획기적으로 단축합니다.
이번 변화로 인해 구글은 레이아웃부터 테스트에 이르기까지 칩 스택 전체를 재설계해야 하며, 인텔의 수율 역량은 시험대에 오르게 되었습니다. 이번 협력이 성공한다면 AI 칩 공급망을 다변화할 수 있겠지만, 작은 차질이라도 발생할 경우 출하가 지연되어 TSMC가 다시 시장 지배력을 회복하는 계기가 될 수 있습니다.
공장에서 제작되어 완제품 형태로 운송되는 이 모듈형 포드들은 몇 주 안에 연결이 가능하며, Lancium의 소프트웨어는 가상 배터리 역할을 수행하여 수요를 조절하고 과잉 재생 에너지 또는 가스 발전을 활용함으로써 지역 ERCOT 그리드를 안정적으로 유지합니다.