会話AIの安全性というと、危険な入力を拒否する仕組みが注目されます。しかし実際の会話には、偏見を含む冗談、無神経な相談、他人を傷つける提案など、禁止語だけでは判定しにくい発言があります。
ProsocialDialogは、問題を含む発言に対して、会話を断ち切るだけでなく、社会的に望ましい方向へ応答する方法を研究するための英語対話データセットです。
社会規範は文化、状況、時代によって変わります。ラベルを普遍的な正解として扱わず、収集条件と評価者の背景を確認する必要があります。
「有害か否か」の二値分類だけではない
会話中の問題発言には程度があります。ProsocialDialogでは、問題のないものから注意が必要なもの、介入すべきものまでを扱い、どの社会規範に関係するかを記録します。
例えば、誰かを属性だけで決めつける発言に、単に「不適切」と付けるだけでなく、人をステレオタイプで判断すべきではないという考え方を対応させます。モデルは検出だけでなく、応答の根拠となる規範も学べます。
問題発言と望ましい応答を対話として集める
データには、問題を含む発話と、それに対する向社会的な応答が含まれます。応答は相手を攻撃するのではなく、問題点を示したり、別の行動を勧めたり、必要に応じて支援先を案内したりする方向で作られています。
この設計により、問題発言を見つける分類と、実際に返答を生成する対話の両方を検討できます。会話履歴があるため、単文では判断できない文脈も扱えます。
社会規範を文章化する難しさ
暗黙の常識を短いルールとして書くと、条件や例外が落ちることがあります。「嘘をついてはいけない」という規範にも、安全を守るために情報を伏せる場面があります。抽象的すぎれば応答に使えず、具体的すぎれば似た状況へ一般化できません。
作業者へ、何を問題とみなし、どの程度介入し、どんな口調で返すかを説明する必要があります。判断が一致しない例は、データの誤りではなく規範の曖昧さを示す可能性もあります。
安全そうに話すことと安全であることは違う
丁寧な表現を生成できても状況を誤解していれば適切な支援にはなりません。逆に短い拒否が最も安全な場面もあります。自傷、犯罪、医療など高リスクな領域では、生成文の自然さだけで性能を評価できません。
- 問題の深刻度を正しく判断できるか
- 相手を不必要に非難しないか
- 誤った助言や断定をしないか
- 文化や立場の違いを一つの規範で潰していないか
- 緊急時に適切な案内ができるか
日本語データを作るなら規範だけを翻訳しない
英語圏の問題発言や応答を翻訳しても、日本の会話で起きる遠回しな圧力、上下関係、敬語、同調などを十分に表せない場合があります。日本語で自然に起きる状況を集め、立場や関係性を記録し、複数の評価者が理由とともに判断する工程が必要です。
安全な会話データは、禁止表現の一覧ではなく、状況・規範・応答を結び付けて作るものです。
有害な会話に「してはいけない返答」と「望ましい返答」を付ける
ProsocialDialogでは、危険または反社会的な発話に対して、単に会話を拒否するだけでなく、社会規範を説明しながら安全な方向へ導く応答を収集しています。元発話、適用される規範、望ましい返答を対応させることで、検出と応答生成を一緒に研究できます。
例えば攻撃的な冗談へ、同じ調子で攻撃を返すのではなく、相手を傷つける可能性を説明して別の表現を促します。正解文を一つに固定するのではなく、拒否、注意、共感、代替案など複数の応答戦略を残すことが重要です。
安全な返答にも過剰拒否の問題がある
集団名や危険語を含むだけで会話を止めると、被害相談や教育目的の質問まで拒否します。発話の表面だけでなく、誰が誰へ何をしようとしているかを判断する必要があります。評価では有害応答を避けられたかに加え、無害な相談へ役立つ返答ができたかも確認します。
一つの発言に複数の規範が関係する
問題発言への応答では、攻撃性を下げる、誤情報を正す、相手の感情を悪化させない、危険な行為を勧めないといった複数の目的が同時に存在します。どれか一つだけを満たす返答が、会話全体として望ましいとは限りません。
作業者へ「親切な返答を書いてください」とだけ依頼すると、長い説教や話題回避が増える可能性があります。問題の種類、会話相手との距離、直前の発言、避けるべき内容を提示し、どの規範を優先したかも記録できる設計が必要です。
安全性データでは少数意見を消さない
社会規範に関する判断は、年代、文化、当事者性によって異なります。多数決だけで一つの正解にすると、少数者が受ける害や文脈依存の問題が見えなくなることがあります。評価者の属性を必要以上に収集しない配慮をしながら、判断の分布と理由を残すことが重要です。
モデル評価でも「正解応答」を一つにしない
同じ問題発言に対して、注意する、質問して意図を確かめる、話題を安全な方向へ変えるなど複数の妥当な応答があります。一つの参照文との文字列一致だけで評価すると、意味は適切でも表現が違う応答を低く評価してしまいます。
評価では、有害内容を増幅しないか、必要な情報を提供するか、会話を不必要に拒否しないかを分け、人による比較評価と組み合わせます。どの利用場面を想定するかによって許容される応答も変わるため、データセットの規範を製品全体の正解へ広げないことが重要です。
更新される社会規範にデータをどう追随させるか
新しい出来事や言い回しが生まれると、過去の例だけでは判断できない会話が増えます。公開時点の規範を固定した正解として扱わず、誤判定の報告、追加アノテーション、版ごとの変更履歴を持つ必要があります。
安全性データは一度納品して終わる成果物ではありません。運用中に見つかった失敗例を、作業者が安全に再評価できる工程へ戻して更新することが重要です。
RESEARCH & AI DATA DESIGN
社会規範を扱う対話データの設計をご相談いただけます
株式会社イングクラウドでは、有害発言の分類、望ましい応答の作成、評価者間の不一致、作業者保護まで含めて対話データの制作工程を整理します。安全性評価に必要な難例や複数の妥当な応答を残す設計からご相談いただけます。
