GyaanSetu AI

AI, 머신러닝 및 LLM 인사이트.

1515 articlesDeep, practical knowledge

예측 모델, 생성형 텍스트, 트레이딩 봇 혼용으로 수십억 달러를 낭비하는 AI 기업들

새로운 산업 보고서는 투자 회사들이 AI를 단일 도구로 취급함으로써 수십억 달러를 허비하고 있다고 경고합니다. 포트폴리오 구성을 위해 예측 모델을 사용하거나 거대언어모델(LLM)의 요약본에 따라 거래를 수행하는 등의 방식은 리스크 가격 책정 오류, 과도한 거래, 그리고 규제 준수 위반으로 이어질 수 있습니다.

AI · 4 min read

Claude Opus 5, Meta Muse Spark 1.1, Gemini가 선도하는 2026년 LLM 순위

20개의 모델에 대해 동일한 워크로드를 실행한 이번 벤치마크 결과, 전문 모델 라우팅(specialist-routing) 방식을 통해 AI 비용을 절감하고 지연 시간을 단축할 수 있는 반면, 플래그십 모델을 기본으로 사용할 경우 비용과 재시도 횟수가 증가할 수 있다는 사실이 드러났습니다.

AI · 3 min read

2026년까지 AI 워크로드에 1,000TWh 필요 – 화석 연료 피커 발전소 급증 전망

2026년까지 AI 기반 데이터 센터는 일본과 독일의 연간 총 수요와 맞먹는 약 1,000TWh의 전력을 소비할 것으로 예상됩니다. 이에 따라 마이크로소프트, 구글, 아마존은 원자력 에너지로 눈을 돌리고 있으며, 경쟁사들은 친환경성과 경제성을 동시에 확보하기 위해 저렴한 수력 및 지열 발전 부지 확보에 주력하고 있습니다.

AI · 3 min read

BYD HyWorldVLA, NAVSIM v1에서 90.59 PDMS 달성

BYD HyWorldVLA, NAVSIM v1에서 90.59 PDMS 달성. BYD가 자율주행 파운데이션 모델 시장에 진출합니다. 새로운 모델인 HyWorldVLA는 NAVSIM v1 벤치마크에서 90.59 PDMS를 기록했습니다. T...

AI · 3 min read

전자 제품 제조 분야의 AI 도입 방법

전자 제품 제조 분야의 AI 도입 방법. 아무 이유 없이 AI 모델을 만들지 마세요. 생산 현장의 문제부터 시작하십시오. 성공적인 AI 프로젝트는 구체적인 문제를 해결합니다. 예를 들어...

AI · 3 min read

OpenAI의 GPT-5.6 Sol, 커스텀 Responses API를 통해 ARC-AGI-3에서 38.3% 기록

OpenAI의 38.3% 성공률은 모델을 공식 ARC-AGI-3 하네스로 평가할 경우 7.8%로 떨어지며, 이는 해당 모델의 강점이 독자적인 Responses API에 내장된 두 가지 추론 시점의 트릭인 '추론 유지(retained reasoning)'와 '문맥 압축(context compaction)'에서 나온다는 것을 보여줍니다.

AI · 4 min read

명시적인 ‘도구 사용’ 프롬프트, 오작동하는 AI 어시스턴트의 문제 해결을 보장한다

저자는 목표만 제시하는 넛지(회복률 0.16)와 도구 재실행을 명시적으로 허용하는 “행동 허가(action-licensing)” 프롬프트를 비교하여 완벽한 1.00의 회복률을 달성했습니다. 이 해결책은 에이전트가 도구를 호출할 수 있고, 도구가 잘못된 입력을 감지할 수 있을 때만 작동합니다.

AI · 3 min read

업데이트 유실 버그로 인해 한 에이전트가 다른 네 에이전트의 작업을 조용히 덮어씀

5개의 동시 실행 에이전트를 대상으로 한 테스트에서 4번의 쓰기 작업이 조용히 유실되었으며, 이로 인해 유실된 작업량만큼의 토큰이 낭비되었습니다. CAS(compare-and-set) 게이트를 추가하여 모든 기여를 복구할 수 있었으나, 토큰 소모량은 5단위에서 9단위로 늘어났습니다.

AI · 4 min read

개발자가 이제 무료 티어에서도 Gemini 에이전트를 크론 잡(Cron Job)처럼 예약 실행할 수 있습니다

이번 업데이트는 도구 호출을 검사하는 환경 후크, 과도한 지출을 방지하는 엄격한 예산 상한선, 그리고 API를 가벼운 크론(cron)처럼 활용할 수 있게 하는 예약 트리거라는 세 가지 새로운 개발자 제어 기능을 도입하는 동시에, 보안 책임은 사용자에게 부여합니다.

AI · 2 min read

SWE-Bench 점수, 500개 엄선된 이슈로 테스트 축소 후 72.7%로 급등

2025년 SWE-Bench 점수인 72.7%는 사람이 직접 검증한 500개의 축소된 작업 세트를 기준으로 한 것이며, 2023년의 1.96%는 전체 2,294개의 이슈 카탈로그를 대상으로 측정되었습니다. 이번 화제의 급등은 갑작스러운 AI 기술의 비약적 발전이 아닌, 테스트 구성의 변화에 따른 결과입니다.

AI · 3 min read