Google、Gemini 4 Argon を発表 これまでで最強のモデルと主張
Google の親会社 Alphabet は Gemini 4 Argon を発表し、コーディングや調査、執筆などのタスクを処理できると説明した。特に防御的サイバーセキュリティ向けに訓練されており、重要なソフトウェア脆弱性を自律的に発見・検証・修正できるという。
Google の親会社 Alphabet は Gemini 4 Argon を発表し、コーディングや調査、執筆などのタスクを処理できると説明した。特に防御的サイバーセキュリティ向けに訓練されており、重要なソフトウェア脆弱性を自律的に発見・検証・修正できるという。
Google DeepMindは新たなフロンティアモデル「Gemini 4 Argon」を発表した。まずFairwind Programの信頼できるサイバー防御担当者に開放し、その後開発者、企業、消費者向けに提供する。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルから。
GPT-6.1 SolがAmazon Bedrockで一般提供され、エージェント型コーディング、コンピューター操作、日常の専門業務に向けて推論能力を強化した。OpenAIによると、DeepSWE v1.1でGPT-6 Astraの約5分の1のタスク単価で同等の成績を達成し、GPT-6 Solの最高成績を6.4ポイント上回った。
OpenAIはGPT-6.1 Solを発表し、安全上の問題で延期された旗艦モデルGPT-6.1 Astraにエージェントコーディング、コンピュータ操作、オフィス業務で迫り、コストは約5分の1だと述べている。
Anthropic は中位モデル Sonnet 5.5 を公開し、前世代 Sonnet 5 より30%速く、トークン消費のペースも大幅に遅いとした。日常業務のアシスタントとして位置付け、コーディングやオフィス文書生成を扱う。
OpenAIはDev Dayで、ソフトウェアエンジニアリング向けエージェントCodexに再利用可能なクラウド開発環境を導入した。パソコン、スマートフォン、クラウドから利用でき、タスクの起動を高速化し、承認済みの設定と権限をチームで共有できる。
OpenAIはDevDayでGPT-6.1 Solを発表した。エージェントによるコーディング、コンピューター操作、専門業務でGPT-6 Astraに近い知能を持ち、標準の入力・出力トークン料金は5分の1だという。
OpenAI は San Francisco の DevDay 2026 で Codex と API の拡張を発表した。Codex には再利用可能なクラウド環境、リポジトリー安全スキャン Codex Security Cloud、デスクトップのコードレビュー画面、刷新した CLI を追加し、Agents API には Computer Use、Tool Search、Context Compaction を導入する。
OpenAI が GPT-6.1 Sol を発表した。公式は Astra に近い知能水準を持ち、コーディング、コンピューター操作、専門業務の場面に対応するとしている。このモデルの API 入力・出力トークン価格は Astra の標準価格の5分の1。
OpenAI が DevDay 2026 の振り返りを公開し、GPT-6 Astra、ChatGPT、Codex、API、安全性、開発者向けの新ツールなど20以上の発表をまとめた。原文は概要のみで、各アップデートの詳細には触れていない。
Latent SpaceのAINewsは9/24~9/25の動向をまとめ、今週公開されたOpus 5.5へのコミュニティーの反応は好意的で、特にコードで解説動画を生成する能力が優れているとした。
Anthropic の Thariq Shihipar は Latent Space ポッドキャストで Claude Code の次段階を語った。Ask User Question、artifacts、Claude Tag、Projects、ハーネスをカスタマイズできる Claude Mods が含まれる。
xAIのGrok 4.7がAmazon Bedrockで提供され、500Kトークンのコンテキストウィンドウとlow、medium、high、xhighの4段階で設定できる推論強度を備える。Responses、Chat Completions、Converse APIに対応する。
AWSはClaude Sonnet 5.5をAmazon BedrockとClaude Platform on AWSで提供すると発表した。コーディングと知識労働向けのより効率的なSonnetと位置付け、多くのタスクで1件当たりの費用が低く、速度も速いとする。
AnthropicはClaude 5.5ファミリーの2番目のモデルClaude Sonnet 5.5を公開した。出力生成速度は30%超向上し、タスク単価は最大30%低下した。複数のベンチマークでOpus 5.5に近い成績を示す。
OpenAIはCodex Originalsの次の段階を開始し、Codexを使う開発者、研究者、クリエイターの実際の経験とプロジェクトを募集している。参加希望者は下のフォームから経験とプロジェクトの紹介を提出できる。
Simon Willison は WeAreDevelopers World Congress North America の基調講演で、2026年の LLM の主要な進展を時系列に整理した。
Simon WillisonはClaude Opus 5.5で3枚のkākāpōの写真からHTML5 canvasのピクセルアニメKākāpō Partyを生成した。少なくとも20羽のオウムが音楽に合わせて跳び、紙吹雪をまく。
Proaction は Codex、GPT-Live-1、GPT-6 Astra で現代的な車両群管理サービスを構築・運営・販売し、売上が60%増え、75時間超を節約した。
Simon Willisonは2026年9月24日のメモで、コーディングエージェントとの協働時間が増すほど、ソフトウェア開発を難しくするという確信が強まると述べた。驚くべき成果を出せるが、潜在能力を十分に引き出すには非常に高度な規律と知識が必要だとする。
Anthropic は Claude Opus 5.5 を公開した。新 Claude 5.5 ファミリー最初のモデルで、大半の作業で Claude Fable 5.1 水準に達し、運用コストは Opus 5 より40%低いとする。Claude Code と Claude アプリの標準モデルになる。
Simon WillisonとJesse Vincentは10月14日水曜日、サンフランシスコでコーディングエージェントの開発者向け夜間交流会を開く。非公式の実演交流形式で、未公開の試み、奇妙な実験、未完成のプロジェクトの共有を促す。正式な講演は不要で、製品紹介の場でもない。
入社半月のエンジニアは、仕様、コード、テスト、PRD、チケットと対応、報告などがすべてClaude Codeで作られると述べた。誰も好んでいないが、最大限の納品を求められる。上層部からコードの公開はボトルネックでないと何度も聞き、L1からL7まで皆が1日12~13時間、Enterを押すだけの仕事をし、誰も内容を読まないという。
Latent Space の AINews によると、Jev の公開動画は2日で3,600万回視聴され、少なくとも六つの再現・類似方式が現れた。ModernBERT ベースの Laya、拡散モデルの DiffusionGemmaJev、Qwen3.5-9B を LoRA 微調整した Bespoke Nimble、SemIf、Jevlike、Kev-0.5B が含まれる。
GitHub Podcastの最新回はAI開発の5つの話題を検討する。AIコードは読み、責任を持つ必要があるが、確認の度合いはリスクに応じる。Skillsはチームの経験を包装したもの、MCPはツールとデータをつなぐ標準で、組み合わせられる。RAGは終わっておらず、学習外の情報を提供し、エージェント、Skills、MCPと同じワークフローに共存できる。
Latent SpaceのAINewsは9月15~16日の動向をまとめ、コーディングエージェントの楽観論を点検する2事例を取り上げた。Steve YeggeはGas Townを閉鎖し、毎月数千ドルのエージェント購読料を払っても、作れたのはGas Townだけだったと認めた。
GitHubはCopilot appとCopilot CLIを使い、Copilot agent runtimeをTypeScriptから80万行超の本番用Rustへ全面的に書き換えた。AIエージェントがコードの大半を書き、128件のPRで段階的に導入し、性能は数桁向上した。
CognitionはGPT-6 AstraでDevinがソフトウェアをテストし、使えることを証明する能力を高める。技術者のコード審査を減らし、納品を速めることを目指す。
Copilotアプリはdiff、端末、ブラウザーを内蔵し、画面を切り替えずAIコードの確認、実行、プレビューを行える。diffは追加を緑、削除を赤で示し、採用、コメント、追加修正に対応する。端末はコマンド実行と複数ウィンドウ切替、ブラウザーはPick & Polishで要素を選びエージェントに調整させられる。
César de la Fuente の研究室は Codex と ChatGPT で現存・絶滅生物のゲノムから抗菌候補分子を探し、薬剤耐性感染症に対抗する。
Mistralは欧州のエネルギー事業者が4万行のFortran 77をC++へ移行するのを支援した。対象はテストや集約された文書がない、物理計算中心の油層シミュレーターだった。チームはまず数値一致を確認するテスト基盤を作り、Skill.mdでエージェントに状態スナップショットの出力と移行モジュールの検証を指示した。その後Vibe CLIで100超のエージェントを起動し、呼び出しツリーを解析し、Mistral OCRで散在する文書を整理した。
MITの研究者がGPT-5.6 SolとCodexを使い、量子計算実験を自律実行し、結果の分析と量子ビットの校正を行った。
1Passwordの技術者はCodexで新機能と社内ツールを迅速に作り、厳格な安全方針を保って本番利用可能にし、開発効率を21%高めた。
OpenAIは内部データを公開し、エージェントの利用、実験速度、タスクの複雑さ、研究加速などでコーディングエージェントがAI研究を変えていると示した。
GitHubはProject HydraFusionの研究プレビューを公開した。実行時の複数モデルの編成でCopilotに最先端のコーディング能力を提供する。Copilot CLIで/experimentalから有効化でき、各モデルが実際に使うトークンの標準料金で課金される。
Copilot appは独立したGit worktreeで複数セッションを同時に動かし、干渉せず各文脈を保つ。sessions viewで名前と進捗を見て、いつでも切り替え、中断から再開でき、依頼を説明し直す必要はない。tailspin-toysでfunded sort機能、アクセシビリティー確認、テストを同時進行する例を示す。
Google DeepMind は Gemini 3.8 Flash と Gemini 3.8 Flash Cyber を公開した。前者は長時間のコーディングと自律エージェント向けで、料金は3.7 Flash と同じく入力100万トークン当たり0.75ドル、出力100万トークン当たり3.75ドルだ。
Multiverse ComputingはQuantization-Aware Healing(QAH)を提案する論文を公開した。GPT-OSS 120Bを60Bパラメーターへ圧縮しMXFP4へ量子化した後、復元したbfloat16チェックポイントではなく、圧縮前の元モデルから直接蒸留する。
Google DeepMind は Gemini 3.7 Flash を公開し、コーディングとエージェント向けの最強の主力モデルと位置付けた。Gemini 3.6 Flash 公開からわずか3週間だ。
EpochとMETRは、人なら長時間かかるコーディング課題をAIが完遂する能力を測るMirrorCodeを公開した。4月に初発表し、追加テスト後に正式公開した。