GyaanSetu AI

AI、機械学習、LLMのインサイト。

1515 articlesDeep, practical knowledge

TikTok、米国のクリエイターを対象としたAIディープフェイク検出器のパイロット運用を開始

このオプトイン形式のサービスでは、Jumioを通じたセルフィーと身分証明書による厳格な本人確認プロセスを完了した一部の米国のクリエイターに対し、AIが自身の検証済み顔特徴と一致すると判断した動画や画像を一覧表示できるダッシュボードを提供します。

AI · 1 分で読めます

新しいCOS APIにより、ブラウザが33GBのAIモデルをサイト間で共有可能に

URLによるルックアップをコンテンツ指定のハッシュに置き換えることで、COS APIは、SHA-256値が既知のファイルをあらゆるサイトがリクエストできるようになります。これにより、ブラウザは同じ33GBのAIモデルを再ダウンロードすることなく、複数のオリジンに対して提供できるようになります。

AI · 2 分で読めます

AIパイプラインがGoogle検索の隙間を0.05ドルのDev.to記事へ変換、インプレッションを15%向上

改良されたワークフローは、インプレッション500超、クリック数50未満、CTR1%未満、かつ掲載順位20位より後のクエリをスクレイピングし、見出しにLlama 3、本文のドラフトにClaude 3.5 Sonnetを活用。各記事のコストを5セント未満に抑えつつ、オーガニックインプレッションを15%向上させます。

AI · 3 分で読めます

評価用ハーネスがモデルのエラーを捏造する可能性がある——「Malformed(不正な形式)」ラベルの背後に隠れた2つのバグ

モデルが嘘をつく前に、評価用ハーネスがあなたに嘘をつく。評価スコアボードでは、両方のエンジンが失敗したと示されていました。Llama3.2は6ケース中5ケースで失敗し、Anthropic Sonnetは6ケースすべてで失敗しました…。

AI · 2 分で読めます

ChromeのWebMCPにより、Reactアプリが型定義されたツールをAIエージェントへ直接公開可能に

WebMCPは、不安定なDOMスクレイピングに代わり、Reactコンポーネントがマウント時に登録する型定義されたツール呼び出しのマニフェストを採用。これにより、Chrome 149以降において、AIエージェントに対しレイアウトに依存しない即時的なインタラクションを実現します。

AI · 3 分で読めます

Carebricksが5,500万ドルの資金調達を実施、エージェントによる検査オーダーとケアプランの自動化を実現へ

Sequoia、Felicis、Optum Ventures、およびY Combinatorの支援を受けるBunkerhillは、Carebricksエージェントの試験運用を開始する計画です。このソフトウェアは、EHRデータの抽出、検査オーダー、ケアプランの更新を行うことができ、臨床医の日常的な調整業務の負担軽減を目指しています。

AI · 2 分で読めます

SEED、学習データを40%削減しながらALFWorldのスコアを91.8に向上

SEEDフレームワークは、エージェントが自身のトランスクリプトを読み、自然言語による教訓を書き出し、それらをポリシーの更新へと蒸留する「エピソード後のプロセス」を追加します。これにより、希薄な報酬信号を、豊かで再利用可能な学習信号へと変換します。

AI · 4 分で読めます

MCP v2がハンドシェイクとセッションIDを廃止、真のサーバーレススケーリングを実現

2026年7月28日にリリースされるMCPバージョン2は、初期化ハンドシェイク、Mcp-Session-Idヘッダー、および3つのレガシーサブシステムを削除することで、プロトコルを完全にステートレスにします。これにより、セッションアフィニティの制約を受けることなく、オートスケールまたはサーバーレスのポッド上で実行が可能になります。

AI · 3 分で読めます

Google Gemma-4 31B、AWS Inferentiaでトークン一致を達成するも、意味不明な内容を出力

Inferentia2 INF2.24xlargeはCPUリファレンスと全く同じトークンストリームを再現しましたが、どちらの実行においても、チャットテンプレートやターンマーカーを欠いた不正な形式のプロンプトが入力されていたため、Gemma-4は意味不明な内容の無限ループに陥りました。ハードウェアは単に、リファレンスコード内のバグをそのまま再現したに過ぎません。

AI · 3 分で読めます

Solo Researcher Cuts LLM Agent Bill 31% to $651 by Logging Every Token

By adding a PostgreSQL logging layer that captured model name, token count, task type, and per-call cost, the researcher identified that raw SEC search results were inflating prompts. Summarizing those results and routing simple checks to a cheaper model drove the 31% savings and nudged accuracy up

AI · 3 分で読めます

Grok BuildのオープンソースCLIにより、モデルの切り替えと全シェルコマンドの監査が可能に

このリポジトリにはCLI、ターミナルUI、およびランタイムのRustソースコードが含まれており、コンテキストの構築、ツールのオーケストレーション、編集の管理方法を詳細に確認できます。さらに、ワークフローを損なうことなく、基盤となるモデルを入れ替えることも可能です。

AI · 4 分で読めます

Claude Code、Cursor 2.0、OpenAI CodexがIDEをフルスタックのコントロールルームへと進化させる

最新バージョンでは、タスクのオーケストレーション、承認ワークフロー、テスト環境、UIを認識したブラウジング機能が追加されました。これにより、AIがチケットの選択、自律型エージェントの実行、人間による承認の取得、そしてビジュアルプレビューの出力まで、すべてを単一のコンソールから行えるようになります。

AI · 3 分で読めます

Meta、100万トークンあたり1.25ドル/4.25ドルでMuse Spark 1.1 APIをリリース

米国の開発者のみが利用可能なこのサービスは、入力トークン100万件につき1.25ドル、出力トークン100万件につき4.25ドルを課金します。新規アカウントには20ドルのクレジットが付与されるほか、海外ユーザー向けにはウェイティングリストが用意されています。

AI · 1 分で読めます

OpenAIのGPT-RedがGPT-5.6の失敗を6分の1に削減、しかし小規模チーム向けの無料ツールはなし

OpenAIの内部モデル「GPT-Red」は、GPT-5.6 Solラインにおける失敗を6分の1に減少させた。しかし、研究論文は理論の提示に留まり、ダウンロード可能なテスト用ハーネスは提供されていないため、小規模チームは独自の決定論的テストを構築する必要がある。

AI · 4 分で読めます