JST 経済安全保障重要技術育成プログラム

大規模言語モデルのミスアライメントに対する
レッドチーミング基盤

大規模言語モデルのミスアライメント(人間の期待や倫理観から外れた挙動)を検出・評価し、 軽減・抑制するためのセキュリティ技術基盤を構築するプロジェクトです。

お知らせ

お知らせ一覧

概要

大規模言語モデルの生成コンテンツには、偽情報・有害情報・差別的内容・指示違反・ライセンス違反・ 個人情報漏えいといったミスアライメントが含まれる可能性があります。外部から入手・改変したモデルについて、 こうしたリスクを独力で評価するのは容易ではありません。

本プロジェクトは、その評価を支援する技術基盤 レッドチーミング基盤(RTF) を開発しています。 RTFは、持ち込まれたモデルに対して多様な攻撃を適用し、応答をミスアライメントの観点で評価・可視化します。 評価には、本プロジェクトが自ら構築する 評価データ基盤・敵対的評価データ基盤 を活用します。

各ページ

プロジェクト情報

事業名経済安全保障重要技術育成プログラム(K Program)
研究代表者佐久間 淳(東京科学大学 情報理工学院 教授)
研究期間2024年度 〜 2029年度(予定)
管理番号JPMJKP24C3
詳細JST プロジェクトデータベース