Appier、LLMが「答えられない」と認識できるかを検証
AppierLLMハルシネーション研究国内
Appier のAI研究チームが2本の論文を公開した。主要LLM28種で「正解が選択肢にない」問題を出すと正答率が30〜50%低下し、DPO学習で約30ポイント改善したという。もう1本は、推論に使う言語が論理性・安全性・文化理解に影響することを示した。
何が発表されたか
- 2026年9月8日、Appier Group(東証プライム: 4180)のAI研究チームが2本の研究論文を公開した。いずれもエンタープライズ向けAIエージェントの信頼性に関わるテーマ。
- 論文1: 情報不足の認識 — 主要LLM 28種に対し、「上記のいずれでもない(None of the Above)」が正解となる選択式問題を出題したところ、正答率が30〜50%低下。モデルは情報が足りないと認めるより、無理に答えを選ぶ傾向を示した。DPO(Direct Preference Optimization)による学習で、「正解が存在しない」ケースの識別精度が約30ポイント改善した。
- 論文2: 推論言語の選択 — モデルが内部的にどの言語で推論するかが、論理的推論・安全性・文化理解の性能に影響することを示した。英語や高リソース言語は数学・知識タスクで優位だが、文化理解タスクと安全性検出ではローカル言語のほうが良好だった。
- 同チームは、AIの評価軸を「正しい答えを出せるか」から「自らの限界を認識し、適切な手法を選べるか」へ拡張する必要があると位置づけている。
実務への影響
1本目は、実案件でAIを使う際に最も痛い失敗——「知らないことを、それらしく答えてしまう」——を正面から測った研究だ。社内FAQボットや商品問い合わせ対応をAIに任せる構成では、「資料に載っていない」と言わせられるかどうかが導入可否を分ける。ハルシネーション対策として検索拡張(RAG)を組む場合も、検索結果が空だったときの振る舞いを別途テストする必要がある、と読める。
2本目は日本語で運用するサービスに直接効く。数値計算や一般知識では英語での推論が有利でも、日本語特有の言い回しや安全性判定は日本語のほうが精度が出る可能性を示唆している。多言語対応サイトを構築する際、「英語で処理して翻訳する」設計が常に最適とは限らない。
いずれも「導入前に何をテストすべきか」の指針として使える内容で、クライアントへのリスク説明にも引用しやすい。
