## 情報源(4本の統合)
- https://youtube.com/watch?v=bDWw4OQ_3hU — OpenAI Codex ハーネス公開(95点)
- https://youtube.com/watch?v=GLlD5FzANNU — Claude が創薬を始めた(Anthropic 2026-08-18 発表・95点)
- https://youtube.com/watch?v=EHXyyCtc_6s — Anthropic 公式・セッションの価値を最大化(95点)
- https://youtube.com/watch?v=Evh_xAfqZU8 — 良い Agent Skills の作り方(95点)

---

## 1. 賢さ = モデル × ハーネス(Codex)

同一モデル GPT-5.6 で ARC-AGI-3 が **13.3% → 38.3%(約3倍)**、出力トークンは **1/6**。直した点は2つだけ:

1. **ターンごとに推論を捨てていた** → 推論の保持
2. **履歴17.5万文字超で古い記憶から削除していた** → 要約コンパクション

- **原則「読むのは自由。書くのは承認」**
- 始め方4歩の2番目が「**壊れてよいサンドボックスでわざと事故らせて自分の目で見る**」

## 2. 創薬が示した「48時間走り切る力」(Claude 創薬)

Claude がタンパク質(ミニバインダー)を設計。**1320個中の一部を実際に作って測定 → 354個が本当に結合。15標的中14で成功(約4個に1個)。Claude が自分で1位に置いた設計は49%が当たった**。

**専門家が1標的あたり数週間〜数ヶ月かけていた工程を24〜48時間で、しかも16標的を同時に走らせた。**

- 設計ツールは全部オープンソース、**手順に当たる16,000のプロンプトもそのまま公開された**
- **★16,000プロンプトのうち科学の話は1/3だけ。残り2/3は「仕事の回し方」** — 部下のエージェントへの任せ方 / 時計の見方 / CPU予算の配分 / 報告する前に自分で確かめる手順
- **48時間止まらずに走り切る。途中でインフラが落ちても Claude 自身が回避して続けた。人間が送ったのは「再開して」という短い連絡だけ**
- **★「次のモデルで見るべき場所も変わる。テストで何点取れるかより、48時間の仕事を崩さずに終えられるか」**

**期待に釘を刺す結果(重要)**:
- TNF標的の12個は**全部 Opus 4.8** が作り、**上位モデルのプレビュー版は0個**。理由は Anthropic 自身が「分からない」と書いている。得意不得意が標的ごとに出る。しかも1回ずつしか走らせていないので運の差も混ざる
- **予測スコアの射程**: 同じ標的の中でなら当たりと外れを見分けられたが、**どの標的で全滅するかは事前に分からなかった**。MB というタンパク質では90個全て外れたのに、そのスコアは成功した標的とほとんど同じだった(= [[instinct-coverage-ratio-is-silent-outside-its-set]] と同型)

別実験: 分析科学の生ファイル(メーカー独自の非公開形式)と最小限の指示だけで、Claude が**読み方を自力で割り出して23分と19分で解析**。純度の答えは**96.4%**(ラボ自身の答えは96.33%)。**ラボの最終レポートは4日後**だった。

二重用途: この種のバイオ能力は一般提供の Fable では止めてあり、科学者向けに審査制で渡す仕組みを準備中。

## 3. セッションの価値を最大化する(Anthropic 公式)

**コスト = 単価 × 量。読ませる(input)より書かせる(output)が高い。**

優先順位4つ:
1. **長いセッションを切る**
2. `/context` で確認し、**使っていない MCP・スキルを外す**
3. **モデル / effort を最適化**(スキルの YAML frontmatter で effort を調節できる)
4. **プロンプトキャッシュを壊さない**

- **キャッシュは API キー5分、サブスクリプションは1時間**(GPT-5.6 側は30分に延長された)
- 壊れる要因 = 放置 / compact / hooks / **途中でファストモードを ON** / モデル変更
- **`/rewind`(Esc×2)は後ろを切るだけなのでキャッシュに優しい**
- **ループをメインセッションで回すとコンテキストを抱えたまま繰り返す → サブエージェントへ**
- CLAUDE.md は **ruthless minimalism(冷酷な最小化)**。命令のドリフトを防ぐ

## 4. 良い Agent Skills の作り方

**SKILL.md を書く「前」が勝負。** 最初に決める6つ: 目的 / 範囲 / 入力 / 出力 / 制約ルール / **完成条件=基準**。

- **description が自動発動を決める**(使わない場面・発動しないでほしいタイミングも書ける)
- **完成条件が AI の止まりどころになる。点数化すると良い**(例: 100個のチェック項目のうち80個適合)
- **SKILL.md には中核だけ書き、詳細は `reference/` へ、毎回同じ結果が必要な機械的処理は `scripts/` へ**
- 検証は **スキルのあり/なしを同じ依頼で比較する**
- 事前の壁打ちには Matt Pocock 考案の「Grill Me」スキルが使われる(当環境の `grill-me` スキルと同系統)

## 横断して見えた共通の主張

1. **モデルを上げるより、段取り(ハーネス)を直す方が効く** — Codex の3倍/6分の1、創薬プロンプトの2/3が段取り
2. **止まりどころ(完成条件)を先に定義したものだけが自走できる** — スキル設計の完成条件、創薬の「報告する前に自分で確かめる手順」
3. **コンテキストは資源であり、切る・外す・壊さないの3操作で管理する**

## アクションアイテム
- 自作スキルの YAML frontmatter に **model / effort** を明示する(`/yt-learn` のような機械的工程は低 effort で足りる)
- `/context` で未使用 MCP・スキルを棚卸しする
- SKILL.md に**点数化された完成条件**を持たせる