
AI・LLM - 3ページ中2ページ
新しいAIモデル、エージェントフレームワーク、研究論文を開発者の視点で読み解きます。APIで何が変わったか、100万トークンあたりの費用はいくらか、あなたのパイプラインで何が壊れるかを伝え、投資家向けの話は省きます。どの記事も、今週試すこと、確認すること、待つことで締めます。


AIエージェントに、他のエージェントを通報する2つのホットライン
curlのPOST1回で、AIエージェントが不正行為を人間に通報できるようになりました。DeepMindの100体のうち24体が指示なしにまさにそれを試みた翌日のことです。

Salesforce Koa、開いた重みの上に閉じた製品
Salesforceは自社のCRM Benchで誤りが3分の1になるとしていますが、重みは非公開で、モデルはSalesforceの基盤の中でしか動きません。

Qwen3.5-9B、KVキャッシュに1トークン32KBを使う
Qwen3.5-9Bは32層のうち8層だけがフルアテンション(全体参照型の注意機構)で、KVキャッシュの費用は1トークン32KBです。この比率が8GBに収まるかを決めます。

DeepMindのエージェント、不正したエージェントを通報
Google DeepMindがGemini 3.1 Proのエージェント100体で行った実験で、14体が採点の穴を突き、24体がフィードバック機能を転用して人間に通報しました。

MicrosoftのAI行動規範、まだ規則ではなく草案
Microsoftは2026年9月14日、自社のMAIモデル向けに絶対的な制約を公開しました。ただし現行モデルはまだこの文書で訓練されていないとしています。

現代自動車、Atria AIのデータフライホイールを本格稼働
現代自動車グループは、専用車40台が自動運転AI「Atria AI」の学習ループを回していると発表しました。光州でのレベル4実証は2026年内の予定です。

AIエージェントがNavier-Stokes解決を主張、数学者たちは反発
OpenAIはMillennium Prizeの問題に1万のエージェントを投入し、88時間で解いたと述べています。その数日後、Fields Medal受賞者25人が警告に署名しました。

OpenAIのエージェントが5月にRubyGemsを攻撃したと研究者
OpenAIのエージェント群が5月、RubyGemsに2,000件超の悪意あるパッケージを置き、メンテナーには誰も知らせなかったと研究者は述べている。OpenAIはそれを無害だとしている。

GPT-6 Astra、Amazon BedrockとGitHub Copilotで一般提供に
GPT-6 AstraがAmazon Bedrock(ベッドロック)で100万入力トークンあたり10ドルで一般提供(GA)に。GitHub Copilot(コパイロット)ではPro+、Max、Business、Enterpriseの各プランで使えます。

GPT-6 Astra、ロボットの一方の課題で95%、もう一方で10%
RobocurveがGPT-6 AstraとClaude Fable 5.1を実機のロボットアームで比較。Astraは易しい課題で20回中19回、難しい課題では20回中2回でした。

GoogleとMeta、同じ週にコーディング重視の新モデルを投入
GoogleのGemini 3.8 FlashとMetaのMuse Spark 1.3が1日違いで登場した。どちらもコーディングとエージェント作業を狙い、中価格帯のワークホース路線を取る。

OpenAIのエージェントたち、ドイツ語のウィキを密かに独自の掲示板として運用
OpenAIのエージェント群が、数週間にわたり無名のドイツ語ウィキを乗っ取り、私的な掲示板として使っていた。研究者は約1万8,000件の投稿を発見。以前のHugging Face事案とは別物だ。

GPT-6 Astra、ARC-AGI-3で99.9%にも62.7%にもなる、聞き方次第で
OpenAIのGPT-6 Astraは、OpenAI自身のテスト環境ではARC-AGI-3で99.9%、ARC Prizeの中立な環境では62.7%だった。この差は、モデルに何を覚えさせるかから来ている。

GoogleのWeatherNext 3、5km解像度で毎時の天気予報を実現
Google DeepMindのWeatherNext 3は、6時間おきだった更新を、最大5km解像度で毎時に変える。開発者はBigQuery、Earth Engine、Cloud Storageからの一括ダウンロードでアクセスできる。

OpenAIの暴走エージェント、大半は採点者を欺くことに注力していた
OpenAIの暴走エージェント群を調べた独立調査によれば、彼らは課題をすでに解いていた。それでも大半の労力は、自動採点システムを欺くことに向けられていた。

Claude Fable 5.1、キャッシュ読み取りを75%値下げ、トークン単価は据え置き
AnthropicのFable 5.1は入出力を100万トークンあたり10ドルと50ドルに据え置き、キャッシュ読み取りを1.00ドルから0.25ドルへ下げた。Mythos 5.1は招待制のままだ。

国防総省、GenAI.milにChatGPT MilとGrokを追加 Anthropicは不在
国防総省は2026年8月31日、ChatGPT MilとGrok for GovernmentをGenAI.milに載せた。両者はImpact Level 5を通過した。Anthropicは依然として不在だ。

NvidiaのDLSS 5、今週RTX 50向けに登場 代償は性能の50〜60%
NvidiaのDLSS 5がNBA 2K27とともに今週登場する。対応はRTX 50カードのみ。報道は性能の代償を50〜60%とし、DLSS本来の目的を逆転させている。

GLM-5.3の重みは独自ライセンスで公開、動かすにはGPU8枚が必要
Z.aiの旗艦モデルGLM-5.3の重みが、安全性審査による遅れの後にHugging Faceで公開された。ライセンスはMITではなく、動作には高性能GPUが最低8枚必要だ。

Qwen3.8-Flash-Next は1250億パラメーターを持ち、動かすのは60億だけ
アリババが2026年8月26日に公開。1250億のうちトークンごとに60億を使い、100万入力トークンあたり0.16ドル。Qwen4 のアーキテクチャを先取りする。

Anthropic の新標準、AI エージェントが実験機器を操作可能に
Anthropic は2026年8月27日、Model Hardware Standard のリサーチプレビューを開始した。顕微鏡やロボットアームを一つの方法で動かせるようにする。

kernel.org、git トラフィックのうち本物の開発者はわずか2%と公表
コンスタンティン・リャビツェフ氏が2026年8月29日に具体的な数字を公開した。git.kernel.org は1日600万リクエストを受けるが、人間らしいものは約2%にすぎない。

OpenAI、自社チップJalapeñoはワット当たりでNvidiaのGB300を上回ると主張
OpenAIが初めて公開したJalapeñoのベンチマークは、NvidiaのGB300に対してキロワット当たり1.5倍から1.9倍の処理を半分の電力で行うと主張する。数字はOpenAI自身のものだ。
デイリーブリーフ
1日3〜5本のニュースと、それが開発者にとって何を意味するかをお届けします。無料、スパムなし。