# 学習日報 2026-06-06 yt-learn 19:00

## 概要
`/yt-learn`(subscriptionsモード)で取得・解析。サブスク新着15件→AI関連8件が60点以上→上位5件NotebookLM解析。LLM Wikiエントリ1件追加(id=505)。

---

## 今日学んだこと(YouTube)

### ★ハーネス / Eval(最重要・X学習と収束)
- **Private Eval/オープンハーネス(Microsoft CEO・44分)**: 「Private Eval(自社の良い仕事の数値定義=一次解決率/誤答率)が最大の知的財産」。巨大データ不要・自社Eval業界標準化で市場有利・自社ハーネス+EvalでAI自律育成が生存鍵・大量エージェント時代はダッシュボード型UIへ
- **ArenaAI GPT5.5がClaude超え1位(30万件実務データ)**: タスク完遂力はClaude勝だがGPT逆転。理由=エラー回復力/操縦性/ユーザー満足度。評価軸が知能→人間との共創適合性へ

### コスト最適化 / ローカルLLM
- **Nemotron 3 Ultra(非中華550B)Mac量子化実行**: 6.2bit INF版10.5tok/s最高精度・思考無効でも3.5-4.4万トークン暴走→ランタイムエラー・高度システムプロンプトで出力制御要
- AI News No.380: Gemma4 QAT・Claude Cowork使用量2倍・Cursorデザインモード/Codexサイドチャット連携・中国モデル移行トレンド(※ポリシー上動向把握止まり)

### モデル動向
- **Oceanus(=Mythos)続報**: Opus4.8比3.2倍高・ゼロショットでインタラクティブ環境構築(ゲーム再現)・音声/視覚マルチモーダル

---

## 今日実装したもの

| ファイル | 変更内容 |
|--------|---------|
| ~/.claude/skills/yt-learn/SKILL.md | PO Token障害記述に因果追記(bgutil削除→障害再発・490行) |
| LLM Wiki id=505 | YouTubeサブスク学習5本保存 |
| ~/.claude/rules/trends.md | サブスク学習エントリ追記・最古5/28削除で100行維持 |
| MEMORY.md | サブスク学習索引1行追記 |

---

## 未実装アクションアイテム(優先順)

- [高] Private Eval概念をgoal-judge/verification-before-completionに「自社固有の数値評価基準」として組込み検討。vvv-bots品質判定をPrivate Eval化
- [中] Nemotron 3 Ultra(非中華550B)をNVIDIA NIM無料枠でKimi(401中)代替ベンチ
- [中] bgutil再導入 or NotebookLMルート常用の判断(字幕インフラ復旧)
- [低] ArenaAI「エラー回復力」観点でCodex(止まらない自律)とClaude(許可待ち)の夜間バッチ完走率比較

---

## LLM Wiki エントリ一覧(本セッション追加)

| id | タイトル | タグ |
|----|---------|------|
| 502 | タイムライン X学習 2026-06-06 | x-learn, timeline, ai, skills, harness |
| 504 | 学習日報 2026-06-06 x-learn 18:30 | 日報, x-learn |
| 505 | YouTube サブスク学習 2026-06-06: Private Eval/ハーネス・Nemotron・Oceanus・ArenaAI | yt-learn, private-eval, harness, nemotron |

---

## 横断所見(X学習+YouTube学習の収束)
本日のX(Anthropic公式Skills/ハーネスサイト)とYouTube(Private Eval/ArenaAI)が**同一パラダイムシフトに収束**: 「モデル単体の知能競争は終わり、それを包むハーネス+独自Eval+エラー回復力(現場適合性)が価値を決める」。複数の独立ソースが同じ結論=信頼度の高いトレンド。