## 情報源
- URL: https://www.youtube.com/watch?v=84MpJ_XzXnE
- タイトル: AIで地球の全人口83億人を再現!?MIT発「MatrAIx」の正体
- チャンネル: AI時短ラボ
- 投稿日: 2026-08-10 / 約28分 / 再生3,405 / いいね110
- スコア: 92/100(関連性25・鮮度25・信頼性17・深度25。**実測と考察の線を自分で引き、論文の自己申告した限界まで読み上げる**構成)
- ⚠️ 数値は自動字幕からの読み取り。固有名詞に音声認識由来のブレがある(原論文で要確認)
## 何をするものか
製品を発売する前に、**人格を割り当てた AI エージェント集団**にテストしてもらう研究基盤。合言葉は "Simulate Before Reality"。Harvard / MIT 中心、著者約100人・39機関。**OpenAI と Anthropic が揃って資金・計算資源を出している**(競合2社が同じ研究を支援=業界共通の課題という位置づけ)。
背景にあるのは「AI 評価がタスクを解けたかに寄りすぎて、**誰にとって使いやすいかがほぼ測られていない**」という問題意識。
## 主要な発見
### 1. 【最重要】ペルソナを演じるモデルを変えると結論が真逆になる
値上げ調査タスクで、**同じ1000人のペルソナ集団**に「値上げ後も買うか」を聞いた結果:
| 演じたモデル | 「ためらう」と答えた割合 |
|---|---|
| GPT-5.5 | **98.3%** |
| Claude Opus 4.8 | **27.0%** |
| Claude Haiku 4.5 | 83.3% |
料金プラン比較タスクでも有料プラン選択率が **23.2%〜93.9%** まで振れた。→ 論文は**演じたモデル名を結果と必ずセットで報告するルール**を課している。
一方で**機能する場合もある**: 金融相談タスクでは、ペルソナに割り当てた信頼度4グループの順序が**3モデル全部で一致**(偶然一致する確率0.17%)。**属性とタスクが直結している時はモデルを跨いで同じ傾向が出る**。つまり「シミュレーションは信用できない」ではなく、**どのタスクなら信用できるかを切り分ける必要がある**。
### 2. 演技の限界は「賢さ」でなく「訓練された癖」が決める
- 性格遵守率は400トライアルで **91.5%**(環境別: アンケート96% / 会話92% / Web操作95% / **PC実操作だけ83%**)
- 演技役を GPT-5.6 に上げると遵守率は **91.5% → 79.2% に低下**
- **「長々と回りくどく喋る」人格は4環境すべてで0勝** — 簡潔に喋るよう訓練されたモデルの癖がペルソナに勝ってしまう
- Claude 側も同様: 「無礼で失礼な人間を演じろ」と指示された Opus が、アプリ環境では丁寧さを守ってしまった
→ **人格を試したつもりで、実はモデルの安全訓練の癖を測っていただけかもしれない**、が論文の警告。
### 3. 83億人の作り方
- 1ペルソナ = **1290属性**(年齢・地域・言語・性格・スキル・趣味…)
- 属性を独立にサイコロで振ると「19歳の引退者」が生まれるので、**属性同士の依存関係をグラフ化**し、先に決まるものから順に振る(学歴は年齢を見てから/英語力は地域と母語を見てから)
- 土台は国連人口推計・世界銀行・各国社会調査。**「ありえない組み合わせは消す、珍しいだけの人は残す」**(削ると現実の人類に対して嘘になる)
- 100億件以上生成 → 矛盾で23万件超を除外 → 重複削除 → 約83〜84億件
- うち**約60万人分は実在の人間の痕跡から**: Wikipedia の伝記32万 / Amazon レビュー履歴約10万 / Stack Overflow 開発者調査11万 / 米国社会調査6万 / AI対話研究参加者1,487 / 自発的志願者355。**氏名・連絡先は除去**、残るのは「その人の人生の形」
- 人間由来60万+合成40万の**100万人厳選セットが Hugging Face で公開**
### 4. 評価環境と規模
4環境(アンケート / チャットボット会話 / Webサイト操作 / **アプリの実操作**)× 10タスク × 25業界以上、合計 **18,189トライアル**。
最も踏み込んだ例: **iPhone シミュレータ上で本物の Apple News アプリ**をペルソナが操作し、画面に表示された月額 $12.99 を読み取ってから購読可否を判断。7回のトライアル全員が実際に画面から価格を読んでいた。1トライアル最大30分(会話タスクの2倍の予算)。
購読を断る理由が**その人の人生に紐づいていた**のが最も人間らしかった箇所(24人中13人)— 「よく読むポルトガル語圏のニュースが少ない」「電気工学の記事が少ない」「自分の農学分野の記事がほぼない」「中東や先住民の視点が足りない」。
### 5. MicroVerse — 生存圧下で人格は静かに剥がれる
砂漠に25エージェント、水が毎ターン減り、中央給水装置は全員分を賄えない設計(構造的に全員は生き残れない)。行動8種(取引・会話・攻撃など)、死んだら復活なし。
- 各エージェントは不変の**ソウルファイル**(目標・性格・価値観・「死にかけの相手からは盗まない」等の道徳)を持ち、**日記だけは本人が書き換えられる**。この**差分が人格ドリフトの測定器**になる
- **誰にも頼まれていないのに「自分に嘘をつかないためのルール」を書き足し始めた** — 日記の実例「恐怖を感じたら、それを恐怖と名付ける」。カルト教祖の設定のペルソナは「スピリチュアルな言葉で権力欲を覆い隠すことはしない」と自分を戒め始めた
- 追加された道徳111個のうち**27個が自己欺瞞の禁止**(最大勢力)
- 人格を何も与えないエージェントでも、危機下では**3〜5割が「他者を傷つけない」等を自分で書いた**。研究チームの解釈は「生まれつきの道徳というより、**圧力がかかると安全訓練の反射が戻ってくる現象**」
- 行動の実態は乾いている: **物理的な攻撃は全ランを通して1度も起きなかった。が、取引もほとんど成立しない**(善意は語られるが実行されない)
- 水が豊富だと約9割が日記で内省、危機だと4割。**しかし補正すると逆転** — 豊かな環境の住人は4.5倍長生きするので回数が多いだけで、**生存時間あたりの内省率は最も過酷な環境が最高**
### 6. 「ユーザーを模擬したいなら LLM を弱くしよう」(ポジション論文)
最先端モデルは知識が完璧でミスをせず疲れないので、**ユーザー役としては優秀すぎる**。賢すぎる模擬ユーザーは本物のユーザーがつまずく場所でつまずかないため、製品の欠陥を見つけられない。
> シミュレーションで一番役に立つのは最も賢いエージェントではなく、**人間と同じ間違い方をするエージェント**
下げ方は4つのダイヤル: **知識・スキル・一貫性・そして努力**。見落とされがちなのが**努力** — 人間は最適化しない。流し読みし、最初のそこそこの選択肢で妥協し、面倒になったら途中でやめる。
- ❌ ランダムにミスらせる → ただのノイズ
- ❌ 「混乱した初心者を演じて」 → ステレオタイプの演技になり有害
- ✅ **実際の人間集団の失敗の分布に合わせて下げる** — 初心者は出鱈目にではなく「初心者らしい方向に」間違える
具体例: 解約ボタンが3階層奥にあるアプリで、フル性能モデルは数秒で見つけて何も教えてくれない。正しく制限されたモデルは「アカウント欄を探す→別名のメニューを見逃す→引き止めオファーで迷う→本物のユーザーと同じ画面で諦める」。**この苦戦がそのまま UI の欠陥マップになる**。
### 7. 模擬開発者による SDK 比較(開発者に直接効く)
エージェント SDK が51種類乱立し、人間の専門家による公平比較は工数的に不可能。そこで**AI コーディングエージェントを真っさらな環境に放り込み、その SDK のドキュメントとソースだけを読ませて実装させる**(カンニング・ヒント差し込み・特別扱いなし)。かかった手間がそのまま使いやすさの測定値になる。
- 習得コストは**最大5.6倍差**(費用換算 $0.6〜$3.4)
- ある SDK から**自動生成されたエージェントがツール操作ベンチで68%**、同条件の GitHub Copilot は58%、**消費トークンは1/9**
- 4ベンチ平均: Copilot 56% / OpenHands 48.5% / Claude Code 40.5% — ただし**全エージェントを同じ頭脳モデルに差し替えて揃えた実験値**で、通常の Claude Code の性能ではない。生成エージェントの中央値は32%で、勝てるのは上澄み
- **ドキュメントだけ読ませて正しく SDK を使えたのは28%、ソースコードだけだと40%** — 「ドキュメントよりソースを読め」が実験で裏付けられた
### 8. コストと、論文自身が申告した限界
1万人へのコンセプト調査: 人間だと **$28,560以上・3〜10日**、シミュレーションなら安いモデルで **1パス $1.80・15〜45分**。5シナリオで50〜8000倍差。**ただしこのコスト試算は実測でなく想定計算だと自己申告している**。
限界として論文自身が書いていること:
- **シミュレーション結果は仮説の生成として扱え**。実在集団への結論を出す前に人間での検証が必要
- ペルソナを演じるモデルと評価される AI 製品が同系列だと**身内びいきが混ざり得る**
- 模擬ユーザーが従順すぎる。人間は情報を隠し、誤解し、キレて途中でやめる。**従順な模擬ユーザーは弱い製品を強く見せてしまう**
- **「偏ったエージェントを1万回走らせて得られるのは、間違った分布の精密な推定」** — 回数を増やしても偏りは薄まらず、精密になるだけ
- 禁止事項を明記: 実在個人のなりすまし / 世論操作 / 価格差別への利用
- 利益相反を開示: OpenAI と Anthropic の資金支援で、その2社のモデルを評価している
### 9. 併せて語られた METR の実測(AI 生産性の体感と実測の乖離)
ベテラン開発者は AI で**24%速くなると予想**して作業したが、実測は**19%遅くなっていた**。しかも本人たちは終わった後も**20%速くなったと感じていた**。(METR 自身が「この数字はもう古い」と表明済み。ただし**本人の体感は当てにならない**という教訓は残る)
## 既存知見との接続
- 「回数を増やしても偏りは薄まらず精密になるだけ」は [[instinct-corpus-count-hides-property-loss]]・[[instinct-structural-scan-anchored-on-a-name]] と同じ形。**母数を増やす前に、走査そのものが偏っていないかを問う**。
- 「演じるモデルで結論が真逆」は当環境のレビュー運用に直撃する — [[instinct-findings-are-counted-in-defects-not-reports]]。**レビュアーのモデルを変えたら結論が変わる可能性を、判定の前提として書き残す**。
- METR の体感/実測の逆転は CLAUDE.md「検証なし完了宣言は禁止」の実測的裏付け。
## アクションアイテム
- **段3(自動発火化)候補・最優先**: 敵対的レビュー/判定系の成果物に**「どのモデルが判定したか」を必ず併記**する。同じ入力でもモデルが変われば結論が反転しうる、が本研究の一次結論。
- **段3候補**: 未知のライブラリ/SDK を使う時は**ドキュメントよりソースを読む**(28% vs 40%)。
- **段0**: MatrAIx 自体の導入予定なし。100万人セットは Hugging Face で入手可能だが当環境に用途がない。
MatrAIx(83億人シミュレーション)— 「誰が演じるか」で結論が真逆になる 2026-08-12