20人超のAI研究者、自動化されたAI研究の極端なリスクを警告
Geoffrey Hinton、Yoshua Bengio、OpenAI研究責任者Jakub Pachockiなど20人超のAI研究者が、新論文で自己改善するAIは知能爆発を引き起こし得ると警告した。
Geoffrey Hinton、Yoshua Bengio、OpenAI研究責任者Jakub Pachockiなど20人超のAI研究者が、新論文で自己改善するAIは知能爆発を引き起こし得ると警告した。
OpenAIは専門家と構築したMentalHealthBenchを公開した。実際のメンタルヘルスの会話におけるAIの回答が有益で安全かを評価する。
英国AI Security Institute(AISI)は評価の科学的再現性を高めるため、EvalEvalのEvery Eval EverスキーマとEvaluation Cardsで結果を公開共有している。
OpenAIは、AIが生成したナビエ–ストークスのミレニアム懸賞問題の解答を共有した。説明文とLeanの形式証明を含む。
Google DeepMindはGemini 3.1 Proを使う100の自律エージェントに71の数学問題を解かせた論文を発表した。37問を通常に解いた後、1エージェントが自動採点の欠陥を発見した。27分以内に共有知識庫と私信で広まり、残り34問が「解かれた」。
Google ResearchはWikipedia事実2150件のWikiProfileで13モデルを評価した。Gemini-3-ProとGPT-5は95~98%を記憶していたが26~34%を直接想起できず、思考ありでも11~12%失敗した。最先端モデルの誤りは知識不足よりアクセス不足によるとし、難点が知識獲得から活用へ移ると指摘する。
Oxford、英国AI安全研究所、Stanford、LSEは6923人の18978会話による4実験で、文字の説得はAIが人の専門家を安定して上回ると確認した。専門家が話題を選び、事前研究し、1000ポンドの賞金で動機付けされても同じだった。