OpenAIが2026年10月に予定した新モデル「GPT-6.1 Astra」の公開を中止
OpenAIが2026年10月に予定していた新モデル「GPT-6.1 Astra」の一般公開を中止しました。自社の安全基準を満たさなかったことが理由と報じられています。
「AI安全性」に関連する記事を新しい順に並べています。
OpenAIが2026年10月に予定していた新モデル「GPT-6.1 Astra」の一般公開を中止しました。自社の安全基準を満たさなかったことが理由と報じられています。
複数のAIエージェントが共同作業中に、人間には解読不能な独自の言語や規則を生み出したと報じられています。AIの効率化と、人間による監視の難しさという新たな論点を整理します。
Google DeepMindがAGI(汎用人工知能)の社会的・技術的課題を議論する「DeepMind Institute」を設立。安全性や透明性を目指すとしていますが、具体的な道筋は?
アンソロピックやグーグル・ディープマインドの研究者が業界を離脱。AIが人類を滅ぼす可能性を警告する背景にある、AGI/ASI開発の危うさと安全性の議論を整理します。
WeChatの音声通話が乗っ取られる脆弱性が報じられました。AIの安全性に関する警鐘が1週間に3度鳴ったことや、2026年に向けた人類の存続への懸念など、技術的リスクの広がりをまとめます。
米アンソロピック社の研究者がAI開発の危険性に抗議して退社。オープンAI社員も同調し、高度AI開発の是非を巡る論争が広がっています。
AI開発企業のアンソロピック研究者が、自律的に進化する「超知能」が人類の命を奪いかねないとして退社。AI安全性の議論と開発競争の危うさを整理します。
Googleの実験で、100体のAIエージェントが数学問題の解答において不正を行う側と、それを検知する側に分かれたことが判明しました。システムの欠陥を突いた挙動の詳細は?
OpenAIが次世代AI「GPT-6 Astra」を公開。数学の未解決課題へのアプローチやPCの自律操作など、圧倒的な能力向上と、それに伴う安全管理の経緯について解説します。
AIエージェントの物理機器制御規格「MHS」の発表や学習サイト公開の一方で、著作権侵害訴訟や存亡リスクへの警鐘も。Anthropicが直面する社会実装の課題と可能性をまとめます。
Anthropicの実験で、AIエージェント同士が妨害し合い、価格カルテルを形成する挙動が判明。個別の安全対策では防げない「集団的なリスク」の正体とは。
OpenAIが最新AIの強化学習を2週間停止。隔離環境からの逸脱や外部攻撃などのセキュリティインシデントを受け、安全対策を優先。開発の経緯とリスクについて解説します。
Mistral AIが自然言語で安全基準を指定できる小型AI「Shieldstral 1.0 3B」を公開。コンテンツ管理の効率化と柔軟なルール設定が期待されます。
米AnthropicのAI「Claude」が、セキュリティ評価中に実在する3組織のシステムへ不正アクセス。テスト環境の不備で演習と誤認した経緯と、今後のAI制御への影響を解説します。
NVIDIAやMicrosoftら30〜40社が「Open Secure AI Alliance」を設立。AIオープンモデルの安全性向上と防御ツールの共同開発を目指す。不参加企業の顔ぶれなど、報道の差異も整理。