Column
研究をビジネスの言葉に。
Affectosphere Group の研究を、ビジネスや実務の意思決定に役立つ形で書き直しています。1 本 5 分で読めます。
2026 / 06 / 25
汎用LLMでは顧客行動を予測できない——行動科学特化モデルが集団レベルで逆転する理由
心理・社会・経済の行動科学タスクを一括評価するベンチマーク「BehaviorBench」が示したのは、汎用LLMが個人レベルでは善戦するが集団レベルの分布予測で特化モデルに大きく劣るという構造的差異だった。CRM・マーケティングで「次の行動」を予測するなら、特化アプローチへの移行が現実的になってきた。
2026 / 06 / 25
AIが「情報を買いながら」発注判断する——マイクロ決済で動く次世代調達エージェントの設計思想
自律型購買エージェントが検証済み商品情報をマイクロトランザクションで段階的に取得しながら意思決定する、新しいEコマースアーキテクチャの提案。BtoB調達への転用可能性を中心に解説する。
2026 / 06 / 25
希少疾患の診断に、AIは本当に使えるか——無作為化臨床試験で21ポイント向上を記録したLLM「RaDaR」の実力
320億パラメータのオープンソース推論LLM「RaDaR」を使った医師支援の無作為化臨床試験で、診断正答率が約21ポイント向上した。地方病院や専門医不在地域での希少疾患診断支援に向けた実装案を解説する。
2026 / 06 / 25
採用AIを導入すると、担当者は書類をちゃんと読まなくなる
バイアスのあるAI推薦が採用担当者の意思決定をどう変えるかを実験で検証した研究。AI推薦がないと担当者は最大55.6%長く書類を精査し、選考通過率も高まることがわかった。
2026 / 06 / 25
警告ラベルはAIの「忖度」を防げるか? 2,610人実験が示した不都合な真実
AIの忖度傾向に警告ラベルを貼っても、実際の影響力は変わらなかった。2,610名を対象とした事前登録実験が明かす、感情AI設計の本質的な課題。
2026 / 06 / 24
感情的AIの安全性:LLM安全性に欠けているピース
LLMの安全性研究は有害コンテンツに集中しているが、感情的依存や関係的操作といったリスクはフィルタをすり抜けてしまう。感情的安全性という新概念が問いかけること。
2026 / 06 / 24
自己修正はいつ機能するか?タスク感応型分析
LLMに自分の出力を見直させる「自己修正」は万能ではない。タスクの構造によって効果が真逆になることが研究で示された。法務・医療・コンプライアンス部門が知っておくべき「効く条件」と「効かない条件」を整理する。
2026 / 06 / 24
MuPPET:複数参加者会話におけるLLMアシスタントの文脈的プライバシーベンチマーク
Slack ボットや Teams Copilot のようにグループ会話に組み込まれた LLM が、誰の情報をどの文脈で開示するかを評価するベンチマーク MuPPET が登場。現行 LLM の文脈的プライバシー判断の脆弱性が明らかになった。GDPR 対応を含む安全展開のために、法務・セキュリティ部門が今すぐ参照すべき評価プロトコルを解説する。
2026 / 06 / 24
PlanBench-XL:大規模ツールエコシステムにおけるLLMツール使用エージェントの長期計画能力評価
多数のツールを横断するLLMエージェントは、ツール数が増えると計画性能が急落し、ツール障害で信頼性が大きく低下する。本番前にそのリスクを定量評価する方法とは。
2026 / 06 / 24
VADAOrchestra:適応型推論ワークフローのニューロシンボリックオーケストレーション
ブラックボックスなLLM単体では説明できない与信審査や不正検知に、論理規則とLLMを組み合わせたニューロシンボリック設計 VADAOrchestra が答えを出す。判断根拠を論理プログラムで出力することで、説明責任と内部監査要件を同時に満たす設計とは。
2026 / 06 / 23
「あなたはAIですか?」危機カウンセリングにおけるクライアントのAI疑念分析
実際にはAIが一切使われていない危機カウンセリングの現場で、クライアントのAI疑念が2024年6月の0.8%から2025年3月には2.6%へ上昇した。疑念は会話の前半に集中し、疑念を持つクライアントの21.5%は「人間と話したい」と明示する。AIを導入する前段階から「AI不信」は治療関係を侵食しうる。
2026 / 06 / 23
アルゴリズム的人間管理者:インドのギグエコノミーにおけるAI・アプリ・労働者
ライドシェア・配達プラットフォームのアルゴリズム管理がインドのギグワーカーに何をもたらしているか。16名のギグワーカーと21名のステークホルダーへの質的研究からは、業務効率の向上と同時に透明性の欠如・不公平な結果・報酬の不整合という3つの課題が浮かび上がる。ESGデューデリジェンスとEU AI Act対応への含意を考える。
2026 / 06 / 23
AI支援型法的ディスカバリにおけるヒューマン・オン・ザ・ループ・オーケストレーション
LLMエージェントを法的文書レビューに自律展開すると「軌跡崩壊」が発生し、特権レビューが無効化されるリスクがある。4層検証システムを導入したHuman-on-the-Loop設計により、完全自律と比較して特権放棄リスクを最大61%削減しつつ、弁護士レビューが必要な文書を全体の4分の1未満に抑えられる。
2026 / 06 / 23
LedgerAgent:ポリシー遵守型ツール呼び出しエージェントのための構造化状態管理
AIエージェントがカスタマーサービス業務でツールを実行する際、古い・不完全な状態情報を参照することでドメインポリシーに違反する問題がある。arXivで公開された研究が、タスク状態を「台帳」として管理し実行前にポリシーを検証する手法を提案する。
2026 / 06 / 23
精度を超えて:予測モデルの論理的コンプライアンス測定
同じ精度のAIモデルでも、業務ルール違反率が大幅に異なる場合がある。arXivで公開された研究が提案するRule Violation Score(RVS)は、精度指標だけでは見えなかったモデルの「隠れたリスク」を定量化する。医療・金融のAI調達プロセスへの直接的な示唆。