## 情報源(yt-learn 2026-08-21 で解析した28本のうち、スコア60点台〜80点台の統合)

---

## 1. オープンモデル6本を用途別に選ぶ(80FjtrTu9KU・2026-08-14時点)

**★選び方の物差しは2つだけ: ①何をさせたいか ②自分の機械に乗るか。賢さの順位は最後でいい**(乗らなければ順位は関係ない)。

| 用途 | モデル | 実行条件 |
|---|---|---|
| 普段使い | **Gemma 4 12B** | 4bitで7.6GB・16GBノートPCで動く |
| 速さ | **Diffusion Gemma** | 最大4倍速・4bitで約13GB |
| コーディング | **Qwen 3.6 27B** | SWE-Bench 77.2%・4bitで約17GB・中古3090で14〜20万円 |
| ツール使用 | **Meta Muse Glimmer** | 17GB版は精度1%低下・32GB版は0.2%低下 |
| 長文 | **NVIDIA Nemotron 75B** | 25万トークン・4bitで47.6GB・3090×2枚 |
| 本気のコーディング | **Poolside Laguna S** | Terminal-Bench 70.2%・4bitで約59GB・DGX Spark 128GB $4699≒76万円 |
| 個人の上限 | **DeepSeek V4 Flash** | 4bit版194GB、荒く潰せば100GB |

個人では動かせない会社向け: MiniMax M3 214GB / GLM 5.2 377GB / Inkling 488GB / V4 Pro・LongCat 約800GB / Kimi K3 約1.4TB。6本とも Apache 2.0 / MIT。

**★順位は測る場所で変わる**: Artificial Analysis(9試験の総合100点)では無料の首位が **Kimi K3 の60点**、有料含む首位が **Claude Opus 5 の63点**で3点差。しかし**人が投票するアリーナでは GLM 5.2 が全体2位で、Kimi K3 は上位に見当たらない**(= `rules/external-claims-verification.md`「軸が揃っているか」と同型)。

## 2. GPT-5.6 の Token 最適化(9ZznKEiirAI)

- 方向性は「収束するとしても大量のトークンで無駄に燃やすのではなくスマートに」。**超激安で85点を取るのか、しっかりお金を積んで90点を取るのか**の判断が要る
- **「とりあえず XHigh 指定」の流れは終わり**。5.5 時代に XHigh/Max でしか届かなかった品質ラインに、5.6 Sol の Low や 5.6 Luna の Max/XHigh でも到達できることが増えた
- **★スキルの YAML の中でエフォートやモデルを選択できるので、「このスキルはこのモデル・このエフォート」という設計が重要になる**(Anthropic 公式動画と一致)
- GPT-5.6 は**コンパクション / マルチエージェント協調 / 決定論寄せ**をセットで訓練。**PTC(プログラマティックツールコーリング)**でトークン効率を上げる
- **プロンプトキャッシングの保持時間が30分に延長**、キャッシュブレイクポイントも設置可能
- **「モデル自体がハーネスエンジニアリングに詳しくなっている」**

## 3. Cloudflare で個人開発インフラを組む(wN2byhrfqN4・最多視聴26k)

構成: フロント **Vite Next**(今年2月登場・Next.js の94-95%が使える・まだβ)/ API Next.js Route Handlers / DB **Cloudflare D1**(SQLite)/ 認証 Better Auth または Clerk / 決済 Stripe。

- **D1 の無料枠**: 読み取り1日500万 / 書き込み1日10万 / ストレージはアカウント合計5GB・1DBあたり最大500MB($5課金で1DB 10GBまで)/ **転送量(エグレス)と帯域幅が無制限**
- **Supabase 無料枠は5GBのエグレス上限がある**ので、ここが最大の差。「バズっても無料枠の中で抑えられる」
- 超過時も良心的: 読み取り100万行あたり$0.001 / 書き込み100万行あたり$1
- **D1 の弱点**: 1DB が10GBを超えるとそれ以降使えない / SQLite なので書き込みが直列 / 全文検索が苦手
- **罠**: インデックスを貼っていないと1ページずつ探す行にも読み取り1がカウントされ、500万をすぐ超える
- **Clerk の罠**: 無料枠だとセッション有効期間が**7日までしか設定できず**、超えると自動ログアウト。無制限には **$25課金** が必要

## 4. Grok Bot — 常駐AIエージェント(POCPkej5yEg)

- **各ボットに専用のクラウドVMが用意され、ブラウザ / ファイルシステム / ターミナルが揃っている**。**24時間動き続ける**
- **複数ボットを同一のユーザースコープ内で並列に協働**できる。「1人の万能なAIに順番に抱え込ませる設計ではない」
- **API の使い分け**: Connectors や MCP が使える場面ではそれを使い、**クリーンな API がないアプリには Computer Use(画面操作)** で対応する2段構え
- **「Show bot once(一度見せる)」** — 一度人が作業の流れを実演すると、その経路をルーティンとして記憶し、スケジュール実行/オンデマンド実行で繰り返せる。**ただし遠回りした操作まで含めて実演したらその遠回りも残る**
- **提供状況**: β。Super Grok Heavy サブスクライバー / Cursor Ultra / Cursor Teams Premium。エンタープライズはウェイトリスト

## 5. 課金・運用の罠

- **thinking ブロック空返却の課金バグ**(R0ileDpA3dg): Opus 4.8 / Sonnet 5 の2機種。**署名だけあって中身が空でも全トークン課金**(規約に明記・返金なし)。**思考トークンは max_tokens の枠も消費する**。対策=思考予算を下げる / 思考機能を無効化 / 使用実績コンソールで日次監視
- **Grok 4.6 は200Kを超えると単価が倍**($2/$6 → $4/$12)になり、コンテキスト窓も実質500Kに半減する(pqpPUucqmoY)
- **Claude Code には `latest` と `stable` の2チャンネルがあり、今年1月頃に分離された。`latest` は「何を入れてもいい」実験版化**しており細かい変更が大量に入る(wgmhzoibSqk。当環境は [[instinct-claude-version-split-terminal-vs-ide]] で既に版の食い違いに嵌っている)

## 6. その他の道具

- **DeepSeek Harness**(JmZVHFqSUcY): `github.com/deepseek-ai/deepseek-harness`。4モード(Standard / PTC / Minimal / Creator)。**Codex や Claude Code をサブエージェントとして使うプラグインが既定は無効で存在する**。コアすら交換可能なプラグイン設計
- **Hermes Agent "Herald Release"**(hngciJmcs78): ナレッジベースの裏付けあり=緑/なし=赤の検証 / ツール実行上限500回 / チャットから `!` でシェルモード / A2A / セルフホスト・OSS
- **Vercel v0 API 一般提供**(8_ltSvHY_1E): インフラとして機能し CI/CD や他の AI エージェントの中から呼び出せる
- **Cloudflare「Cache Response Rules」**: オリジン応答がキャッシュに書き込まれる前に動くルールエンジン。**応答を見てからキャッシュ動作を決められる**・全プランで利用可能
- **Hooks で MD→HTML 自動生成**(lvOEvLI-bAM): PostToolUse hook に変換スクリプトを1本登録するだけ。効果は①**変換はローカルスクリプトなので AI の利用量が一切かからない** ②認知負荷。**発動条件を絞る設計が肝**(本文の最初の行が見出しか / frontmatter にタイトルがあるか / 本文800文字以上 / 設定フォルダや node_modules 配下でないか)。注意点は①フック設定は実行前に git commit ②**終了コード0で終わる要件が守られていないと、変換の失敗がエージェント本体の作業を止める**
- **フォルダ設計が命**(GkwMTOmwtJw): **Claude の検索は「名前で検索してから中身を当てる」方式**なのでフォルダ名・ファイル名を整えることが直接効く。**CLAUDE.md はフォルダごとに置け、親から子へ降ってくる**。**1セッション1案件**。**「やらないこと」も CLAUDE.md に書く**。週1で整理する
- **Cursor Cloud Agents**(IzCGwDoQ72M): `/goal` は**条件が満たされるまで目標を手放さない**。**曖昧な目標を渡すと終わりも曖昧になる**。**サブエージェントは専用VM+隔離コピー+独立ブランチ+新しい文脈**なので衝突しない代わりに**親の背景を渡さないと子は前提なしで判断する**

## ⚠️ 採用しないもの(当環境の憲法に抵触)

- `hTrJKw3_MPU`(Qwen 3.8 Max)と `AraMQ2ToGRY`(MiniMax M3)は、**Claude Code の `ANTHROPIC_BASE_URL` / `ANTHROPIC_AUTH_TOKEN` を書き換えて他社モデルを使う手順**を実演している。課金憲法および中華系API禁止に抵触するため**採用しない**
- 副産物として `AraMQ2ToGRY` の投稿者は「Claude Code の並列を回しているが**認知負荷が最近めっちゃ高くなってきている。ちゃんとビジュアライズしていかないと認知が間に合わない**」と述べている(当環境の [[project-agent-live-dashboard]] と同じ課題)