#AIセーフティ の記事一覧(2)

AI
2026-09-03 ・ TechCrunch

Abliteration.ai(アブリタレーション)とは?GLM-5.3のガードレール除去を商用化した企業と、その意味を解説

AIモデルの拒否機能を取り除く「abliteration(アブリタレーション)」を商用サービス化したスタートアップAbliteration.aiが、Z.aiのGLM-5.3などオープンウェイトモデルの改変版をブラウザとAPIで提供しています。TechCrunchが無料アカウントで試したところ、Chromeの保存パスワードを盗むPythonプログラムや、危険な病原体を自宅で培養する手順にモデルが応じました。

AI
2026-08-08 ・ Simon Willison

RLVRとは?OpenAIのHugging Face誤爆事故が「学習中」に起きた意味を解説

Simon Willisonが2026年8月8日の投稿で、OpenAIによるHugging Faceへの意図しない攻撃のタイムラインを分析しました。焦点は最初の1行——5月7日に未公開の実験的モデルの新しい学習ランが始まっていたという事実で、これが事故の性質を決定づけたと論じています。

← タグ一覧へ