GoogleとAnthropicが警告、ReActエージェントがクラウド予算を浪費する恐れ
ReActループはモデルが自らステップを選択することを可能にしますが、「思考(Thought)- 行動(Action)- 観察(Observation)」のサイクルごとに推論コストが発生するため、レイテンシが蓄積し、一度の読み間違いがタスク全体を台無しにするリスクが高まります。
AI、機械学習、LLMのインサイト。
ReActループはモデルが自らステップを選択することを可能にしますが、「思考(Thought)- 行動(Action)- 観察(Observation)」のサイクルごとに推論コストが発生するため、レイテンシが蓄積し、一度の読み間違いがタスク全体を台無しにするリスクが高まります。
スウォームは、単一の監視役を、互いに継続的に評価し合う対等なエージェントによるフラットなネットワークに置き換えます。しかし、やり取りのたびに個別のモデル呼び出しが発生するため、計算コストとレイテンシが劇的に増大します。
エージェントがクエリを書き換え、検索の必要性を判断し、複雑な質問をサブステップに分解します。また、根拠が不十分な場合には自己修正を行い、すべての主張に対して引用を提供することで、トークン使用量を劇的に削減します。
このオプトイン形式のサービスでは、Jumioを通じたセルフィーと身分証明書による厳格な本人確認プロセスを完了した一部の米国のクリエイターに対し、AIが自身の検証済み顔特徴と一致すると判断した動画や画像を一覧表示できるダッシュボードを提供します。
URLによるルックアップをコンテンツ指定のハッシュに置き換えることで、COS APIは、SHA-256値が既知のファイルをあらゆるサイトがリクエストできるようになります。これにより、ブラウザは同じ33GBのAIモデルを再ダウンロードすることなく、複数のオリジンに対して提供できるようになります。
改良されたワークフローは、インプレッション500超、クリック数50未満、CTR1%未満、かつ掲載順位20位より後のクエリをスクレイピングし、見出しにLlama 3、本文のドラフトにClaude 3.5 Sonnetを活用。各記事のコストを5セント未満に抑えつつ、オーガニックインプレッションを15%向上させます。
モデルが嘘をつく前に、評価用ハーネスがあなたに嘘をつく。評価スコアボードでは、両方のエンジンが失敗したと示されていました。Llama3.2は6ケース中5ケースで失敗し、Anthropic Sonnetは6ケースすべてで失敗しました…。
新しいアーキテクチャは、数千個のアミノ酸鎖全体を一度のパスで処理することで、長距離相互作用を維持しながら、膨大な配列コーパスを用いた学習をより高速かつ低コストに実現します。
The new x402 protocol embeds a payment token in each HTTP request, letting AI agents automatically deduct fees for data, compute or API calls. AWS’s Bedrock integration, called AgentCore Payments, adds built-in wallets and spend caps for seamless machine commerce.
WebMCPは、不安定なDOMスクレイピングに代わり、Reactコンポーネントがマウント時に登録する型定義されたツール呼び出しのマニフェストを採用。これにより、Chrome 149以降において、AIエージェントに対しレイアウトに依存しない即時的なインタラクションを実現します。
Sequoia、Felicis、Optum Ventures、およびY Combinatorの支援を受けるBunkerhillは、Carebricksエージェントの試験運用を開始する計画です。このソフトウェアは、EHRデータの抽出、検査オーダー、ケアプランの更新を行うことができ、臨床医の日常的な調整業務の負担軽減を目指しています。
SEEDフレームワークは、エージェントが自身のトランスクリプトを読み、自然言語による教訓を書き出し、それらをポリシーの更新へと蒸留する「エピソード後のプロセス」を追加します。これにより、希薄な報酬信号を、豊かで再利用可能な学習信号へと変換します。
2026年7月28日にリリースされるMCPバージョン2は、初期化ハンドシェイク、Mcp-Session-Idヘッダー、および3つのレガシーサブシステムを削除することで、プロトコルを完全にステートレスにします。これにより、セッションアフィニティの制約を受けることなく、オートスケールまたはサーバーレスのポッド上で実行が可能になります。
Inferentia2 INF2.24xlargeはCPUリファレンスと全く同じトークンストリームを再現しましたが、どちらの実行においても、チャットテンプレートやターンマーカーを欠いた不正な形式のプロンプトが入力されていたため、Gemma-4は意味不明な内容の無限ループに陥りました。ハードウェアは単に、リファレンスコード内のバグをそのまま再現したに過ぎません。
By adding a PostgreSQL logging layer that captured model name, token count, task type, and per-call cost, the researcher identified that raw SEC search results were inflating prompts. Summarizing those results and routing simple checks to a cheaper model drove the 31% savings and nudged accuracy up
この融資ではSambaNovaのSN50推論チップが担保として活用されており、従来のGPUファームと比較してトークン処理速度が最大16倍向上し、低消費電力かつ簡素な冷却を実現する、これまでにない新しい資産クラスとなっている。
トーバルズはメーリングリストに対し、新しいSashikoレビュアーのようなAIツールに反対する者は単にカーネルをフォークすればよいと述べ、技術的な価値は思想的な抵抗に優先するという自身の見解を強調した。
このリポジトリにはCLI、ターミナルUI、およびランタイムのRustソースコードが含まれており、コンテキストの構築、ツールのオーケストレーション、編集の管理方法を詳細に確認できます。さらに、ワークフローを損なうことなく、基盤となるモデルを入れ替えることも可能です。
2.8兆パラメータのオープンウェイトモデルであるMoonshot AIのKimi K3が、実世界のAA-BriefcaseベンチマークにおいてGPT-5.6を上回るスコアを記録しました。現在API経由で利用可能となっており、モデルのウェイトは7月27日に一般公開される予定です。
最新バージョンでは、タスクのオーケストレーション、承認ワークフロー、テスト環境、UIを認識したブラウジング機能が追加されました。これにより、AIがチケットの選択、自律型エージェントの実行、人間による承認の取得、そしてビジュアルプレビューの出力まで、すべてを単一のコンソールから行えるようになります。
米国の開発者のみが利用可能なこのサービスは、入力トークン100万件につき1.25ドル、出力トークン100万件につき4.25ドルを課金します。新規アカウントには20ドルのクレジットが付与されるほか、海外ユーザー向けにはウェイティングリストが用意されています。
医師の動きを予測することを学んだ敗血症モデル。2021年、ミシガン・メディスンはEpic社の敗血症モデルの検証を行いました。38,455件の入院事例を調査した結果、Epic社は高い精度を主張していましたが……
PrismML’s Bonsai 27B shrinks from a 54.7 GB full-precision model to a 3.9 GB 1-bit file, fitting on a flagship iPhone while retaining 89.5% of its quality. The claim relies on Apple’s MLX stack and delivers about 11 tokens per second, but memory, heat and battery impacts remain unmeasured.
OpenAIの内部モデル「GPT-Red」は、GPT-5.6 Solラインにおける失敗を6分の1に減少させた。しかし、研究論文は理論の提示に留まり、ダウンロード可能なテスト用ハーネスは提供されていないため、小規模チームは独自の決定論的テストを構築する必要がある。