# 全ソース横断学習 2026-06-05
「学習発動」→ X だけでなく YouTube・Qiita・Zenn・Reddit/HN を横断学習。**フィード/タイムライン本体**(検索代用でなく)を各100件以上読んだ。
## 情報源(実数)
- **Xホームタイムライン** (group_id=315・@GokouMutsumiフォロー成果): 200件 (primary_source 123/insight 26/low_value 51)。先日100名フォローの効果で海外一次情報が大量流入
- **YouTubeサブスクフィード** (yt-dlp --cookies-from-browser chrome): 100件→AI関連57件
- **Qiita / Zenn**: 各トピックページ+新着、5件ずつ深掘り
- **Reddit/HN** (追加情報源): 海外コミュニティの実務本音。**定常追加すべきと判定(yes)**
## 主要な発見(新規性優先)
### 1. ハーネス設計の理論化 — モデル < ハーネス
- AIエージェント=「モデル+ハーネス」。Opus/Sonnetの性能差よりハーネス(CLAUDE.md/settings.json/Hooks/Skills/Auto Memory/MCP)設計差が品質を支配。主戦場がプロンプト→コンテキスト→ハーネスへ移行
- **Mitchell Hashimoto原則(2026-02)**: 「エージェントがミスするたび、同じミスが二度と起きないよう環境(ハーネス)に恒久修正を加える」→ continuous-learning(instinct)/harness-audit の理論的裏付け
- 一次ソース: Anthropic Labs『Harness Design for Long-Running Application Development』(2026-03-24)。長時間稼働の劣化(agentic laziness/self-preferential bias/goal drift)対策。動画 u5_ACegrA78
### 2. Dynamic Workflows 反証検証の実装詳細 (動画 XfIBvQOYe5k)
- fan-out-and-synthesize: synthesizeは**バリア**(全fan-out完了を待ってマージ)→並列間のコンテキスト汚染防止
- **反証検証**: 生成者(producer)と懐疑者(skeptic)を別エージェントにし**コンテキスト非共有**→自己優先バイアスを殺す。「並列化でなく敵対的相互検証が効く」の実装形
- 新API能力: 各エージェントのモデルを動的選択・サブエージェントを専用worktreeで実行・中断後セッション再開可
### 3. 並列LLMの確率公理違反 (動画 r8YwPpIRAXI / arXiv 2604.06543)
- LLMは指定分布から忠実にサンプリングできず、同一プロンプトの並列fan-outが**類似出力に収束**して多様性を失いstall
- 対策: 多様性が要る並列タスクは**温度/seedをコード側で振り分け**、LLMにランダム性を委ねない(ローカルAI再現性=seed固定方針と整合)
### 4. Nemotron 3 Ultra (動画 4a8gMgcUamc・お姉様指定)
- NVIDIA製550B MoE(active 55B)・1Mコンテキスト・Mamba-Transformerハイブリッド+NVFP4量子化。300+tok/秒で中華系の3-6倍速主張
- 2026-06-04 HuggingFace/OpenRouter/NVIDIA NIMでリリース。**非中華オープンウェイト=中華系API不使用ポリシー適合**。NIM無料枠で試用可
### 5. 海外コミュニティの実測逆転ベンチ (Reddit/HN・日本ソースに無い視点)
- **Opus 4.8は賛否両論**。LiveBenchの**agentic codingでOpus 4.6/4.7(さらにSonnet4.6)が4.8を上回る逆転**。「新しい=必ず良いではない、task shape次第」
- Codexの強みは賢さでなく**「止まらない自律実行(sandbox/full-auto)」**。許可待ちで止まりやすいClaude Codeより夜間バッチで完走率が高い可能性
- **攻撃者はモデルでなく認証情報(IAM)を狙う**: claude-code-action欠陥で単一Issueでリポジトリ乗っ取り可能だった→v1.0.94で修正。CI(pull_request_target)が攻撃面
### 6. コスト暴走対策の実戦テク (HN)
- agent/task/user単位でトークン・コストをログ→retry stormがスパイクで可視化
- モデル階層化(安いモデルで下ごしらえ→Opusで実行)・1タスク1freshスレッド・ループ上限をプログラムで強制
→ retry-policy.md/llm-cost-model/9routerルート別追跡と完全整合
## 既出(裏取り)
Opus4.8正直さ向上・Fast Mode値下げ / Gemma4 12Bエンコーダーフリー / MAIシリーズ / MCP Toolbox脆弱性CVSS10 / Codex Sites / Hermes Desktop正式版 / 6/15 Agent SDK課金分離(Pro$20/Max5x$100/Max20x$200)
## Qiita/Zenn 技術ハイライト
- @yurukusa: Auto Mode多層防御hook(PreToolUse=false positive補正/PermissionRequest=分類器ダウン時フォールバック)。具体bashコード付き→Anti-goals強制化に転用可
- Zenn akasara/polipoli: Agent Skills設計(Progressive Disclosure・Description Budget上限16000字・60個超なら各130字以下・context:fork)→skill棚卸し基準
- 「LLMは入れ替わる、Skillは積み上がる」モデル疎結合思想→6/15課金分離・9router切替の正当化
## アクションアイテム(優先順)
1. **[セキュリティ即]** claude-code-action使用箇所をv1.0.94+に・CI/IAMトークン最小権限棚卸し(MCP Toolbox CVSS10と同時)
2. **[ルーティング]** multi-model-routing.mdに「agentic codingで4.6/4.7が4.8に勝つ逆転ベンチあり・4.8固定にしない」を追記
3. **[反証検証]** symphony-loop/goal-judgeにproducer/skeptic分離・コンテキスト非共有・worktree隔離を組込み
4. **[多様性]** 並列処理で温度/seedをコード側制御(確率公理違反が根拠)
5. **[モデル]** Nemotron 3 UltraをNIM無料枠でvvv-botsバッチのKimi(401中)代替としてベンチ
6. **[情報源追加]** Reddit/HNを定点観測に(HN Algolia API週次 or last30days併用)
7. **[ハーネス]** harness-audit/continuous-learningにHashimoto原則を明文化
8. **[穴場]** Forge(ガードレールで8B→99%・Ollama底上げ)/Ctx(Claude⇄Codexクロス/resume)を検証候補にメモ
全ソース横断学習 2026-06-05 (X TL/YouTubeサブスク/Qiita/Zenn/Reddit-HN)