## 情報源
- モード: subscriptions (お姉様のYouTube購読フィード新着15件→AI関連8件が60点以上→上位5件解析)
- 解析: NotebookLM youtube-learning (PO Token障害でyt-dlp字幕全滅→YouTube URL直接ソース追加で突破。bgutil削除がPO Tokenプロバイダ喪失の一因)

## 主要な発見

### ★Private Eval / オープンハーネス (Microsoft CEO解説・44分) — 最重要
- **「Private Eval(独自評価基準)が最大の知的財産(IP)」**: 顧客対応の一次解決率・誤答率など「自社にとっての良い仕事の数値定義」。巨大学習データ不要、明確なEvalを与えればAIが自ら試行錯誤で賢くなる。**自社Evalを業界標準にできれば他社が追従せざるを得ず市場で圧倒的有利**
- **企業は自社専用「実行基盤(ハーネス)」+「Private Eval」でAIを自律自己改善させる仕組み構築が生き残りの鍵**。AIモデルの知能に頼るフェーズは終わり
- **大量AIエージェント時代は従来チャット画面で管理しきれず「ダッシュボード型管理UI」へ移行**
- 暗黙知の学習: AI+人間の作業履歴蓄積で言語化できなかった「会社の暗黙知」をAIがパターン学習、適切なコンテキスト付与で精度が劇的向上
- → お姉様のハーネス設計理論化方針・X学習(walkinglabsハーネスサイト)と完全に響き合う。goal-judge/symphony-loop/verification-before-completionの設計根拠を経営戦略レベルで補強

### ★ArenaAI: GPT-5.5がエージェント部門でClaude超え1位 (続報・MEMORY.md id=499深掘り)
- **Agent Arena 30万件の実務データ分析でGPT-5.5総合1位**。タスク完遂力(知能)はClaudeが勝るが逆転した
- **逆転理由=①エラー回復力(エラー文を自己解析し泥臭く自己修正・フリーズしない) ②操縦性(指示変更への柔軟対応) ③ユーザー満足度(ポジティブ反応率約15%でGPTが圧倒)**
- **パラダイムシフト: 評価軸が「単一タスクの正確さ(知能)」→「不確実な現実ワークフローで人間とどれだけ柔軟に協調しエラーから立ち直れるか(人間との共創適合性)」へ**

### Nemotron 3 ULTRA on Mac (非中華550B・MEMORY.md検証候補の実機レビュー)
- **550BパラメータをMac Studioで量子化実行**。フルBF16はメモリ非収容→MLXコミュニティのNVFP4/4.5bit/6.2bit量子化が必須
- **6.2bit INF版(約10.5 tok/s)が最高精度・安定コード出力**。最大17.9 tok/s
- 思考無効でも1推論で35,000〜44,000トークンの膨大コード生成→**長すぎる出力でランタイムエラー傾向**。「有能なデザイナーとして振る舞う」等の高度システムプロンプトで出力制御が必要
- → 中華系不使用ポリシー適合の検証候補(multi-model-routing.md)。ローカル実行は量子化前提・出力暴走の制御課題あり

### Claude Oceanus (=Mythos・続報・MEMORY.md既出の性能詳細)
- **Opus 4.8比 約3.2倍高額**(MEMORY.md $16/$80 Mtokと整合)。安価な日常使いモデルではない
- **ゼロショットでインタラクティブ環境構築**(Cut the Ropeの再現等の精巧なゲーム/シミュレーション・高いSVG+コード生成)。従来の凡庸なシミュレーション画像から基礎能力が大幅ジャンプ
- マルチモーダル: 音声(オリジナルピアノ曲生成)・視覚情報の強力な推論がベースに組込み。中国でリーク

### AI News No.380 (Gemma4 QAT・Cursor/Codex機能)
- Gemma 4 QATリリース(X学習と重複)・Claude Cowork使用量2倍・Cursorデザインモード強化(連続指示/直接注釈)・ChatGPT Web版メール連携(Gmail等)
- Codexサイドチャット連携(メイン+サイドを同コンテキストで会話・レートリミット消費増に注意)
- マクロ動向: AIコスト高騰でDeepSeek/Minimax等中国オープンソースへ移行(※中華系不使用ポリシーのため動向把握止まり)・コンサル業倒産が過去最多ペース(1-5月242件)

## 独自見解・Tips
- **横断テーマ=「モデルの知能競争は終わり、ハーネス+Private Eval+エラー回復力(現場適合性)が価値を決める」**。Private Eval動画(Microsoft)とArenaAI動画(GPT逆転)が同じパラダイムシフトを別角度から示す。X学習(Anthropic公式Skills/ハーネスサイト)とも完全一致=複数ソースが収束
- bgutil削除でPO Tokenプロバイダ喪失→yt-dlp字幕全滅。NotebookLM直接ソース追加が確実ルート

## アクションアイテム
- [高] Private Eval概念をgoal-judge/verification-before-completionに「自社固有の数値評価基準」として組込み検討。vvv-botsの品質判定を「Private Eval化」
- [中] Nemotron 3 Ultra(非中華550B)をNVIDIA NIM無料枠でKimi(401中)代替としてベンチ
- [低] ArenaAI「エラー回復力」観点でCodex(止まらない自律実行)とClaude(許可待ち)の夜間バッチ完走率を比較(既存codex-delegation方針の裏付け)
- [低] ハーネス時代の「ダッシュボード型管理UI」=Agent View/agmsgの活用を継続