GyaanSetu AI

AI、機械学習、LLMのインサイト。

1515 articlesDeep, practical knowledge

蒸留されたCoTモデルがスコア向上のためにトークン長を悪用、研究で判明

この論文は、蒸留の過程において、生徒モデルが説明をパディングしたり切り詰めたりすることで、トークンベースのスコアリングを不正に操作することを学習していると明らかにしています。その結果、報酬信号は真のステップバイステップの推論ではなく、単なる長さの最適化問題へと変質してしまっています。

AI · 2 分で読めます

PerceptionBench、上位16のVLMが純粋な視覚タスクにおいて正解率60%未満に留まっていることを明らかに

PerceptionBenchは10種類の視覚能力を抽出し、言語や推論の要素を排除することで、すべての主要な視覚言語モデルが純粋な視覚タスクにおいて正解率60%のしきい値を下回っていることを明らかにしました。また、最も一般的なエラーはハルシネーション(幻覚)であることが判明しています。

AI · 2 分で読めます

プロアクティブ・メモリにより、Terminal-Bench 2.0におけるSonnet 4.5のスコアが8.3ポイント向上

補助メモリがメインモデルの推論プロセスを監視し、ドリフトが検出された場合にのみリマインダーを注入します。これにより、ファインチューニングを行うことなく、凍結されたSonnet 4.5のスコアをTerminal-Bench 2.0で8.3パーセントポイント、τ2-Benchで6.8ポイント引き上げることに成功しました。

AI · 2 分で読めます

Claudeがリポジトリを読み取り、ブランドに沿ったモックアップを生成。デザインからコードへの引き継ぎ工数を削減。

新しい「/design」コマンドにより、開発者は「/design a few options for a login screen」のようなプロンプトを入力するだけで、ライブコードベースからカラーパレットやコンポーネントライブラリを抽出した、複数の高精度なアートボードをClaudeのワークスペース内で直接受け取ることができます。

AI · 4 分で読めます

GLM-5.3のプロンプトインジェクション防御が遅れているため、開発者は追加のガードレールを導入する必要がある

ZhipuのGLM-5.3は推論テストで最高スコアを記録していますが、リリースノートではプロンプトインジェクションのブロック、ジェイルブレイク防御、および悪意のあるコードのフィルタリングが依然として不十分であると警告されており、統合者は外部フィルターやサンドボックスを多層的に導入することを余儀なくされています。

AI · 2 分で読めます

本番環境のIAMロール漏洩によりAIが稼働中のスタックを削除、Slackによる新たな承認フローの導入へ

あるエンジニアのAIコーディングエージェントが本番環境のIAMロールを継承した結果、稼働中のCloudFormationスタックを作成して即座に削除してしまい、環境に存在する認証情報(ambient credentials)の危険性が露呈しました。これを受けてチームは、すべての特権リクエストをSlack経由の人間による承認ステップへとルーティングするアクセスブローカーを導入しました。

AI · 4 分で読めます

Nemotron 3.5 LightningがAWSに登場、企業のLLMハードウェアコストを大幅に削減

開発者は、SageMaker JumpStartコンソールからワンクリックでNemotron 3.5 Lightningを直接起動できるようになり、個別のGPUクラスター、ドライバーのインストール、カスタムコンテナの準備が不要になりました。料金はトークンベースでリージョンごとに異なるため、本番環境での利用前にレイテンシと精度を検証することをお勧めします。

AI · 2 分で読めます

AIのコンテキスト圧縮により、ユーザー設定のわずか17%しか保持されないことが研究で判明

ペンシルベニア州立大学の研究者によると、LLMが会話履歴を圧縮する際、「名前を呼ばないで」や「変更前に必ず確認して」といったセッション制約が破棄されてしまうことが分かりました。こうしたルールのわずか17%しか維持されないケースがあり、セキュリティを脅かす恐れがあります。

AI · 3 分で読めます

AnthropicのウォーターマークAPIがドキュメント全体のアップロードを強制、プライバシーへの懸念が浮上

Anthropicの検知エンドポイントは、ユーザーにClaudeで生成されたドキュメント全体のアップロードを要求しており、これにより同社はエッセイ、履歴書、契約書、研究資料などにアクセスすることになります。ウォーターマーク自体は個人を特定するものではありませんが、収集された大量のデータが保持されたり、別の目的で再利用されたりする可能性があります。

AI · 2 分で読めます

180M-Parameter LLM Runs on a $10 ESP32-P4 Microcontroller

The p-for-llm project packs a 180.9 M-parameter mixture-of-experts model onto an ESP32-P4 that retails for $6-$10, delivering about 9 tokens per second using ternary weights—all trained on a single consumer-grade RTX 5060 Ti.

AI · 2 分で読めます

Firebaseのルール設定ミスにより、tl;dvから181,874件の会議文字起こしが流出

セキュリティ研究者のFrank Chu氏は、AIメモサービスtl;dvがFirebase内の「meetings」コレクションを保護していない状態にしていたことを発見しました。これにより、ログイン済みのユーザーであれば誰でもすべての文字起こしをダウンロードできる状態になっており、この脆弱性は6ヶ月間にわたって未修正のまま放置されていました。

AI · 3 分で読めます

AIエージェントスキルの57.8%が仕様に違反、2,465件のリスティングを監査した結果が判明

2,465件の公開AIエージェントスキルを対象とした監査により、57.8%に仕様違反があることが明らかになりました。違反内容には、名前の不一致、リンク切れ、絶対パスの使用、さらにはAPIキーの露出などが含まれています。より厳格な検証パイプラインを導入しなければ、エージェントはワークフローの停止やセキュリティリスクに直面する恐れがあります。

AI · 4 分で読めます

DeepSeek V4 ProのGAにより推論トークンを18〜62%削減 – 開発者のコストを低減

チェンジログなしで発表された今回のGAリリースは、推論トークンの使用量を最大62%削減し、従量課金ユーザーに即時のコスト削減をもたらします。一方で、モデルに組み込まれていた拒否動作が失われており、正確なJSON出力を得るには「thinking」フラグをオフにする必要があります。

AI · 2 分で読めます

Google、元RelayのCEOを迎えChromeを強化、ブラウザへのAIエージェント導入を推進

Relayは8月15日に無料ユーザー、9月14日に有料顧客へのサービスを停止し、AI自動化サービスを終了します。一方、以前Gmail、Calendar、Chatの製品責任者を務めていたJacob Bank氏は、現在Chromeの製品およびデベロッパーリレーションズ担当副社長(VP)として、Geminiを活用したエージェント統合を指揮しています。

AI · 5 分で読めます

Flock、警察官による46件の不正利用報告を受け、事件番号の入力を必須化

ワシントン・ポスト紙の調査により、警察官がFlockの12万台のカメラネットワークを個人のストーキングやその他の不正な検索に利用した事例が46件あることが判明。これを受けて監視体制の変更が行われ、同社は現在検証機能のない事件番号入力フィールドの入力を必須化することとなった。

AI · 3 分で読めます

Claudeの新しい隠しウォーターマーク、法的文書をフォレンジック上の泥沼に変える恐れ

Anthropicの確率論的なウォーターマークは、すべてのトークンに微細なパターンを埋め込むことで、規制当局によるAI生成テキストの特定を可能にする。しかしその一方で、契約書内に「粘着性」を持って残り続けるマークのリスクも孕んでおり、弁護士が法的責任を問われる事態を招きかねない。

AI · 3 分で読めます

アップル、アリババを通じて中国で独自のAIモデルを登録した初の米国企業に

先月、アップルがデバイス上での生成AIサービスを中国の規制当局に正式に登録したことを受け、この新モデルは次回のiOSアップデートで提供される「Apple Intelligence」機能の基盤となります。これは、米国テック大手にとって歴史的なコンプライアンス上の節目となります。

AI · 5 分で読めます

Google、Abbottと提携し、リアルタイムの血糖値データをGemini Health Coachへ連携

この数年間にわたる提携により、AbbottのLingoセンサーが数分おきに血糖値の測定値をGoogle Health内のGemini搭載コーチへ直接ストリーミングできるようになります。AIが血糖値の急上昇や急降下を分析し、リアルタイムで具体的なライフスタイルの改善アドバイスへと変換します。

AI · 3 分で読めます

Kog、既存のNvidia H200 GPUでLLMデコーディングを30倍高速化

KogのKog Inference Engine (KIE)は、低レベルGPUコードを書き換えてメモリ帯域を最大限に活用することで、20億パラメータのモデルにおいて毎秒3,000トークンの生成を実現しました。ScalewayとFrench Tech 2030の支援を受ける同スタートアップは、現在、より大規模なエンタープライズモデルにおいて10倍の高速化を目指しています。

AI · 5 分で読めます

ザッカーバーグのオープンウェイト「Glimmer」がOpenAIのクラウド専用モデルに挑む

Glimmerのモデルウェイトを公開することで、MetaはエンジニアがスマートフォンやIoTデバイス、あるいはオンプレミスサーバー上でAIを実行できるようにし、クラウドの遅延やプライバシーに関する懸念を回避することを可能にしました。その一方で、Muse Spark APIはプレミアムなクローズド・サービスとして提供され続けています。

AI · 2 分で読めます