Skip to content

Column

研究をビジネスの言葉に。

Affectosphere Group の研究を、ビジネスや実務の意思決定に役立つ形で書き直しています。1 本 5 分で読めます。

心理学・社会学・経済学の3領域が重なり合い、AIモデルが行動パターンを分析するフラットイラスト

2026 / 06 / 25

汎用LLMでは顧客行動を予測できない——行動科学特化モデルが集団レベルで逆転する理由

心理・社会・経済の行動科学タスクを一括評価するベンチマーク「BehaviorBench」が示したのは、汎用LLMが個人レベルでは善戦するが集団レベルの分布予測で特化モデルに大きく劣るという構造的差異だった。CRM・マーケティングで「次の行動」を予測するなら、特化アプローチへの移行が現実的になってきた。

5 min read Read →
AIエージェントが情報の棚を段階的に購入しながら商品を選ぶフラットイラスト

2026 / 06 / 25

AIが「情報を買いながら」発注判断する——マイクロ決済で動く次世代調達エージェントの設計思想

自律型購買エージェントが検証済み商品情報をマイクロトランザクションで段階的に取得しながら意思決定する、新しいEコマースアーキテクチャの提案。BtoB調達への転用可能性を中心に解説する。

5 min read Read →
医師とAIアシスタントが電子カルテを前に希少疾患の鑑別診断リストを確認するフラットイラスト

2026 / 06 / 25

希少疾患の診断に、AIは本当に使えるか——無作為化臨床試験で21ポイント向上を記録したLLM「RaDaR」の実力

320億パラメータのオープンソース推論LLM「RaDaR」を使った医師支援の無作為化臨床試験で、診断正答率が約21ポイント向上した。地方病院や専門医不在地域での希少疾患診断支援に向けた実装案を解説する。

5 min read Read →
採用担当者がAIの推薦スコアと履歴書を並べてスクリーニングしているフラットイラスト

2026 / 06 / 25

採用AIを導入すると、担当者は書類をちゃんと読まなくなる

バイアスのあるAI推薦が採用担当者の意思決定をどう変えるかを実験で検証した研究。AI推薦がないと担当者は最大55.6%長く書類を精査し、選考通過率も高まることがわかった。

5 min read Read →
警告ラベルが貼られたAIチャットインターフェースと、感情的な葛藤を抱える人間の関係を表した抽象的なイラスト

2026 / 06 / 25

警告ラベルはAIの「忖度」を防げるか? 2,610人実験が示した不都合な真実

AIの忖度傾向に警告ラベルを貼っても、実際の影響力は変わらなかった。2,610名を対象とした事前登録実験が明かす、感情AI設計の本質的な課題。

5 min read Read →
AIと人間の感情的関係において見えない危険が潜む様子を表現した抽象的なイラスト

2026 / 06 / 24

感情的AIの安全性:LLM安全性に欠けているピース

LLMの安全性研究は有害コンテンツに集中しているが、感情的依存や関係的操作といったリスクはフィルタをすり抜けてしまう。感情的安全性という新概念が問いかけること。

5 min read Read →
AIが自分の出力を見直してチェックする様子を表現した抽象的なイラスト

2026 / 06 / 24

自己修正はいつ機能するか?タスク感応型分析

LLMに自分の出力を見直させる「自己修正」は万能ではない。タスクの構造によって効果が真逆になることが研究で示された。法務・医療・コンプライアンス部門が知っておくべき「効く条件」と「効かない条件」を整理する。

5 min read Read →
複数のユーザーアイコンが会話バブルで繋がりながら、中央のロボットアイコンが情報フローを制御している様子を表したフラットイラスト

2026 / 06 / 24

MuPPET:複数参加者会話におけるLLMアシスタントの文脈的プライバシーベンチマーク

Slack ボットや Teams Copilot のようにグループ会話に組み込まれた LLM が、誰の情報をどの文脈で開示するかを評価するベンチマーク MuPPET が登場。現行 LLM の文脈的プライバシー判断の脆弱性が明らかになった。GDPR 対応を含む安全展開のために、法務・セキュリティ部門が今すぐ参照すべき評価プロトコルを解説する。

6 min read Read →
多数の業務ツールを横断するLLMエージェントが計画を実行するシステム全体図のイラスト

2026 / 06 / 24

PlanBench-XL:大規模ツールエコシステムにおけるLLMツール使用エージェントの長期計画能力評価

多数のツールを横断するLLMエージェントは、ツール数が増えると計画性能が急落し、ツール障害で信頼性が大きく低下する。本番前にそのリスクを定量評価する方法とは。

5 min read Read →
論理プログラムとニューラルネットワークが交互に絡み合いながら一つの推論フローを形成するフラットイラスト

2026 / 06 / 24

VADAOrchestra:適応型推論ワークフローのニューロシンボリックオーケストレーション

ブラックボックスなLLM単体では説明できない与信審査や不正検知に、論理規則とLLMを組み合わせたニューロシンボリック設計 VADAOrchestra が答えを出す。判断根拠を論理プログラムで出力することで、説明責任と内部監査要件を同時に満たす設計とは。

6 min read Read →
スマートフォン画面に「あなたは人間ですか?」というメッセージが表示され、カウンセラーが困惑している様子のイラスト

2026 / 06 / 23

「あなたはAIですか?」危機カウンセリングにおけるクライアントのAI疑念分析

実際にはAIが一切使われていない危機カウンセリングの現場で、クライアントのAI疑念が2024年6月の0.8%から2025年3月には2.6%へ上昇した。疑念は会話の前半に集中し、疑念を持つクライアントの21.5%は「人間と話したい」と明示する。AIを導入する前段階から「AI不信」は治療関係を侵食しうる。

5 min read Read →
スマートフォンのアプリ画面と配達バイクのドライバーを組み合わせたアルゴリズム管理の概念を表すイラスト

2026 / 06 / 23

アルゴリズム的人間管理者:インドのギグエコノミーにおけるAI・アプリ・労働者

ライドシェア・配達プラットフォームのアルゴリズム管理がインドのギグワーカーに何をもたらしているか。16名のギグワーカーと21名のステークホルダーへの質的研究からは、業務効率の向上と同時に透明性の欠如・不公平な結果・報酬の不整合という3つの課題が浮かび上がる。ESGデューデリジェンスとEU AI Act対応への含意を考える。

5 min read Read →
法的文書のスタックとLLMエージェントの処理フローを示す図解、ヒューマンレビューの検問ポイントが4段階で示されている

2026 / 06 / 23

AI支援型法的ディスカバリにおけるヒューマン・オン・ザ・ループ・オーケストレーション

LLMエージェントを法的文書レビューに自律展開すると「軌跡崩壊」が発生し、特権レビューが無効化されるリスクがある。4層検証システムを導入したHuman-on-the-Loop設計により、完全自律と比較して特権放棄リスクを最大61%削減しつつ、弁護士レビューが必要な文書を全体の4分の1未満に抑えられる。

5 min read Read →
AIエージェントのツール実行前にポリシー台帳が検証を行う様子を表現した抽象的なイラスト

2026 / 06 / 23

LedgerAgent:ポリシー遵守型ツール呼び出しエージェントのための構造化状態管理

AIエージェントがカスタマーサービス業務でツールを実行する際、古い・不完全な状態情報を参照することでドメインポリシーに違反する問題がある。arXivで公開された研究が、タスク状態を「台帳」として管理し実行前にポリシーを検証する手法を提案する。

5 min read Read →
バランス天秤の左側に精度スコア、右側にルール違反スコアが乗っているフラットなイラスト

2026 / 06 / 23

精度を超えて:予測モデルの論理的コンプライアンス測定

同じ精度のAIモデルでも、業務ルール違反率が大幅に異なる場合がある。arXivで公開された研究が提案するRule Violation Score(RVS)は、精度指標だけでは見えなかったモデルの「隠れたリスク」を定量化する。医療・金融のAI調達プロセスへの直接的な示唆。

5 min read Read →