Column
研究をビジネスの言葉に。
Affectosphere Group の研究を、ビジネスや実務の意思決定に役立つ形で書き直しています。1 本 5 分で読めます。
2026 / 07 / 16
「あの時と同じだ」は危険——AIが因果メカニズムで歴史類比を精査する新技術CANAの経営インパクト
LLMが歴史的類比を「表面の類似」でなく「因果メカニズムの一致」で評価するCANA(Causal Analogical Researcher)が提案された。市場参入・規制対応の現代ビジネスケーススタディで有効性を確認。「前例がない意思決定」をAIで支援するとき、なぜ因果類比でなければ危険なのかを経営視点で整理する。
2026 / 07 / 16
「クラウドは高い」は本当か——コーディングエージェント28日実運用データが示す逆転条件
クラウドAPI(Claude Opus)とオンプレ量子化OSS(GLM-5.1/5.2)を各28日間の実運用ログで比較。プロンプトキャッシュヒット率99.3%でAPIの実効コストはオンプレを下回った。一方でFix Commit Ratioはオンプレが2.6〜4.9倍高く、コスト・品質・DevExの三軸で判断する経営フレームを整理する。
2026 / 07 / 16
「LLMで不正検知」に踏み出す前に——49本の論文をさらって見つかった、致命的な報告の抜けと7つの役割整理
不正検知やコンテンツモデレーションにLLMを使う事例は増えています。ところが49本の関連文献をレビューすると、意思決定あたりのレイテンシ・コスト・信頼較正を同時に報告している論文はゼロでした。本番導入で「見えない失敗」を避けるために何を測るべきか。LLMの運用役割を7つに整理したFORTEフレームワークを、リスク・コンプラ担当の視点で読み解きます。
2026 / 07 / 16
AIアバターの共感は「相槌ワード」より「うなずき」で決まる——若年ユーザー36名が教えてくれた、非言語バックチャネルの効きどころ
感情支援型のAIアバターに共感を感じてもらうには、何を足せばいいのか。若年成人36名を対象にしたユーザー実験は、言語的な相槌ワードよりも、うなずき・視線・表情といった非言語バックチャネルの方が明確に好まれることを示しました。ジェンダー差も出ています。メンタルヘルスや接客のアバターUIを設計する人に向けて、感情AIの視点から読み解きます。
2026 / 07 / 16
1B以下で10Bクラスの精度を出す感情AIモデル ── Light-MERが変えるオンデバイス感情認識のビジネス地図
大型マルチモーダル感情モデルは「精度は高いが重すぎる」という壁で実用化が止まっていた。知識蒸留でその壁を突き破った軽量モデルLight-MERが、スマホ・車載・ウェアラブルへのオンデバイス感情認識をどう現実的な選択肢に変えるか、5分で解説します。
2026 / 07 / 14
「自信満々に間違える」AIをどう手なずけるか——金融QAの内部状態プローブで誤答をトリアージする
金融領域のLLMで最も損害が大きいのは「自信を持った誤答」です。同一質問を8回再サンプリングして全一致した「確信のある回答」のうち、FinQAベンチマークでは15〜23%が誤りだったという研究があります。残差ストリームへの線形プローブを使って、出力から見えない内部状態で誤答をトリアージする方法と、社内への実装シナリオを考えます。
2026 / 07 / 14
「法務文書を外部APIに送れない」問題は、オープンウェイトLLMで突破できるか——COLIEE 2026での実証が示すリーガルAI導入の現実解
「外部クラウドに契約書を送るのはセキュリティ的にNG」という壁で、法務AIの導入が止まっている企業は多い。COLIEE 2026で条文含意タスク1位を記録したこの研究は、クローズドAPIを一切使わずオープンウェイトモデルだけで競合水準の精度を実証した。さらに「プロンプト形式を変えるだけでF1が0.34→0.56」という結果は、モデル投資より先に見直すべきPoC設計のポイントを教えてくれる。
2026 / 07 / 14
「AIでメールを書き換えれば返信が増える」は本当か——1万6880通のフィールド実験が明かした、感情ポジティビティという本命経路
AIによるメールのトーン書き換えは、開封率・返信率・返信速度への直接効果ゼロだった。しかしplayfulトーンへの書き換えが送信者の感情的ポジティビティを高め、そのポジティビティが返信率を大きく予測することが6社・1万6880通のフィールド実験で明らかになりました。「AI導入したのに返信率が変わらない」の正体を読み解きます。
2026 / 07 / 14
社員の「次のキャリア」をAIが提案する時代——履歴書の時系列・学歴データから遷移確率を学ぶSTEPの現場応用
職歴・学歴・スキルを時系列で読み込み、「次に就くべき職種」を予測するSTEPというモデルが arXiv に公開されました。社内タレントマネジメントへの応用という観点から、HR部門・経営企画・リスキリング施策の担当者が「自社でどう試せるか」を考えます。
2026 / 07 / 14
「ながら運転」より「目の前のハザード」が引き継ぎを決める——マルチモーダル計測から始めるドライバーモニタリング再設計
半自動運転での引き継ぎ失敗の原因を、私たちは長らくドライバーのわき見や眠気に求めてきました。ところがシミュレータ実験は、引き継ぎ挙動を最も強く決めるのはドライバーの状態より「目の前に何があるか」という文脈だという結果を示します。この知見は、ドライバーモニタリングとテレマティクス保険の設計思想を根本から問い直します。
2026 / 07 / 13
「このAIエージェント、どこまで審査すべき?」を毎回ゼロから議論するのをやめる——12次元スコアリングで社内エージェントをリスク階層化する
社内で内製されるAIエージェントが増えるほど、「これは軽い審査でいいのか、役員決裁レベルなのか」の線引きが属人化していきます。TrustX Agent Risk Classification Framework(ARC)は、7種類のエージェントを12次元でスコアリングし、5段階の自律性と組み合わせて3段階のガバナンス出力を返す枠組みです。リスク管理・法務・IT統制の現場でどう試せるかを、部署とKPIまで含めて考えます。
2026 / 07 / 13
AIの説明は信じている。でも、その説明を検査したのは誰ですか?——概念ベースXAIを監査するConceptSMILE
「AIがこう判断した理由はXです」という説明を、私たちは規制当局にも顧客にも提出しています。でも、その説明自体が正しいかを検査した人はいますか。ConceptSMILEは概念ベースXAIの信頼性を摂動で監査するモデル非依存フレームワークです。眼底画像の実験ではMedSAM由来の視覚概念がサロゲート忠実度R^2=0.8503を示しました。AIガバナンス部門でどう試せるかを、部署とKPIまで含めて考えます。
2026 / 07 / 13
ハルシネーション検出を全部パスした回答が、実は別の薬の話だったら——臨床RAGの「欺瞞的グラウンディング」
引用は実在する。忠実度も高い。ハルシネーションもゼロ。それでも、薬剤Xについて聞いたのに返ってきたのは薬剤Yの臨床証拠だった——。この失敗は既存の評価指標では見えません。13モデルの検証では敵対的条件下でDG率が8〜87%、ドメイン特化モデルでは86.7%に達しました。エンティティ帰属検証という新しい監査レイヤーを、ファーマコビジランスや医療情報部門でどう試すかを考えます。
2026 / 07 / 13
「心の話はAIにしたくない」は本当か——開示を決めていたのは、トピックではなく知覚リスクと知覚利益だった
オランダの代表サンプルN=1,388を対象にした実験から、AIチャットボットへの健康情報の開示意欲を決めるのは「身体の話か、心の話か」というトピックの種類ではなく、ユーザーが感じる利益とリスク、そして個人特性だと示されました。感情AIの設計にとって、これはかなり効く知見です。
2026 / 07 / 13
「この検査、本当に撮る必要ありますか?」——AIに“データを取りに行くかどうか”を判断させると、検査負担が55%減った
多モーダルAIの研究はふつう「全部のデータが揃っている前提」で精度を競います。でもSAGEAgentは逆を行きました。患者ごとに『次の検査は本当に必要か』を能動的に判断するLLMエージェントで、予測精度を保ったまま平均取得負担を55%削減。病院の検査コスト最適化から、与信審査の追加書類請求、設備保全の追加検査まで——『情報を取りに行くコスト』がある仕事すべてに効く発想を、部署とKPIまで含めて考えます。