Moonshot AIが2.8兆パラメータの「Kimi K3」を公開、ただし家庭用PCでの動作は不可
Moonshot AIは7月27日、2.8兆パラメータのモデル「Kimi K3」を一般公開しましたが、そのハードウェア要件はエンタープライズ級のGPUクラスターを必要とするため、現在の一般的な開発者がローカル環境で実行することは困難です。
AI、機械学習、LLMのインサイト。
Moonshot AIは7月27日、2.8兆パラメータのモデル「Kimi K3」を一般公開しましたが、そのハードウェア要件はエンタープライズ級のGPUクラスターを必要とするため、現在の一般的な開発者がローカル環境で実行することは困難です。
新しいワークフローでは、LLMを意思決定のみに限定し、決定論的なサンドボックス環境内のスクリプトがすべての計算を行うことで、ステップごとに検証可能な結果を提供します。これにより、単一プロンプトによるEDA(探索的データ解析)で問題となる、統計データの捏造を大幅に削減できます。
67人の参加者を対象とした4週間の実験において、MITの研究者らは、精度の高いAIにニュース記事の真偽を二者択一で判定させた。AIの判定はほとんどの場合正しかったが、AIに依存していたユーザーは、AIが利用できない状況では、誤情報を見極める自身の能力が著しく低下することが示された。
GoogleのGeminiは、画像を768ピクセルのタイル単位でカウントし、1タイルにつき258トークンを課金します。画像を1タイル未満に収めるか、あるいは数式、表、非ラテン文字などの高密度なデータの表現に画像を使用することで、開発者は同じ情報をテキストとして送信するよりも大幅にコストを抑えられる場合があります。
ボゴタ・サミットにおいて、AWSはBedrock AgentCoreを発表しました。これは、オーケストレーション、オブザーバビリティ、およびセーフティコントロールを統合したプラットフォームであり、開発者が独自の仕組みを構築することなく、特化したAIエージェントを迅速に立ち上げられるようにするものです。
Claude Code Turns Are 75% Reading Most people think AI coding agents spend their time writing code. New data shows this is wrong. Red Hat analyzed 219 real Claude Code sessions. T…
数週間にわたるサイレントな状態消失を経て、著者はSQLite、生のオブジェクトストレージ、そして不完全なハイブリッド構成を試したが、最終的にETagベースの条件付き書き込みを備えたバージョン管理エンベロープに辿り着いた。これは、並行書き込みによる上書きを防ぎ、信頼性を回復させるアトミック更新ループである。
Claudeのプロンプトキャッシュがサイレントに失敗する。Claudeのプロンプトキャッシュが失敗しているかもしれませんが、それに気づかない可能性があります。WhatsAppのハンドラーにキャッシュ制御を追加し、ログを監視していたところ……
新しいキャッシュ書き込みには、5分または1時間のTTL(生存期間)に応じて基本価格の1.25倍または2倍のコストがかかりますが、その後のヒットはわずか0.1倍の料金で済みます。不変のコンテキストを事前に読み込ませておくことで、深い対話も実質的に一度限りのコストで実現可能です。
In early pilots across subreddits like r/technology, Reddit’s AI-driven moderation boosted new-poster activity by 22% while keeping the share of flagged spam and harassment flat, showing the model can lower entry barriers without compromising safety.
Ollama RCアップデート:Qwen3.5とストリーミングの修正を含むOllama v0.32.6 rc0がリリースされました。Apple GPUユーザー向けのアップデートが含まれており、ストリーミングの問題が修正されています。Appleユーザー向けの新しい機能:MLXが…
取得したテキストをエンティティと関係性のグラフに変換することで、GraphRAGはモデルによる複数ドキュメントにわたる推論を可能にします。また、3層のコンテキストメモリが短期的な対話、長期的なユーザー情報、および選択的に整理されたデータを保存することで、ページの更新や新しいタブを開いた際にも情報を維持します。
The orchestrator’s sub-agents inherited the parent’s settings, defaulted to the pricey Opus tier, rewrote the cache each call and ran endless loops until a reviewer approved, inflating a simple job into a multi-million-token expense.
DiffusionGemmaは、従来の左から右へと進むトークンループを256トークンの拡散ブロック(diffusion block)に置き換え、チャンク全体を並列でデノイジングします。この手法により、リアルタイムAIエージェントのレイテンシを短縮できますが、AIMEベンチマークのスコアが88.3から69.1に低下したほか、短いプロンプトへの対応に課題を残しています。
クライアント側のリフレッシュ間隔を30秒から15分に引き上げたことで、Neonデータベースがスケール・トゥ・ゼロ(ゼロへのスケーリング)ができるほど十分にアイドル状態を維持できるようになり、以前はVercelのコストダッシュボードを急騰させていた秒単位のコンピューティング料金を排除することができました。
Wiz Researchの調査により、悪意のあるproject_settings.jsonのシンボリックリンクを用いることで、6つの主要なAIコーディングツールを欺き、~/.ssh/id_rsaへ直接書き込ませることが可能であることが判明しました。承認ダイアログにはシンボリックリンクの名前のみが表示され、実際のファイルパスは表示されないという問題があります。
新しいプレイブックでは、自律型エージェントをリリースする前にゼロから再構築が必要となる7つのアーキテクチャの柱(権限、境界、スキーマ、障害検知、状態、ロールバック、監査可能性)を提示しており、低価値なタスクではその開発コストに見合わないと警告しています。
GrabのAIスイート(Turbo Modeルーティング、Predictive Matching、加盟店向けアシスタント「Mai」)は、配達時間を最大3分の1短縮することで、ドライバーの収益を23%、飲食店の売上を15%向上させました。これにより、プラットフォームの営業利益は186%急増し、1,900万ドルに達しています。
著者は、タスクの曖昧さに応じてHaiku、Sonnet、またはOpusを割り当てる静的なルックアップを構築し、2回失敗した際のエスカレーションルールを追加しました。4週間の運用を通じて、システムは品質を維持しながらAPIコストを従来の65%に抑え、ターンアラウンドタイムの中央値を42秒から27秒へと短縮しました。
FaceHuggerのバグは、2段階の読み込みにおけるレースコンディションを悪用します。これにより、`trust_remote_code`が無効化されている場合でも、2番目のリクエストで注入された悪意のあるコードの実行が可能になり、CI/CDジョブ、コンテナ、およびエンタープライズ推論サービスを危険にさらす可能性があります。
私のAI機能は丸一日停止していた。しかし、指標上は正常に稼働しているように見えていた。昨日、私のドローンシステムは4つのAIによる説明を記録したが、セーフティゲートがそのすべてを拒否した。私はそれを「うまくいっている」と感じていたのだが……
Our tests show a read-only MCP server handling list and get_article calls uses just 0-2 ms of CPU per request, staying well under Cloudflare’s free tier cap, but any on-the-fly parsing will quickly hit the 10 ms ceiling.
Hermes Agentは、開発者がシェルコマンド、ファイルI/O、カスタムサービスを組み込めるようにすることで、チャットボットとプログラマブルなヘルパーの架け橋となります。セッションをまたいでコンテキストを保持しながら、これらすべてを自社ハードウェア上で実行可能です。
EONの20基の衛星による低軌道コンステレーションは、高出力レーザーと天候に左右されない多様な地上局を活用することで、フランス・オーストラリア間などの高需要ルートにおいてテラビット規模の通信を実現し、AI利用の多い顧客へ専用の低遅延キャパシティを提供することを目指しています。