**AIエージェント「ハーネス」設計ガイド(2026年最新)**

「AIエージェント ハーネス 設計」というクエリは、まさに今最も重要なトピックの一つです。プロンプトエンジニアリングの次に来るレイヤーとして、**ハーネスエンジニアリング(Harness Engineering)**が急速に注目されています。

### ハーネスとは何か

**ハーネス = モデル(LLM)以外のすべて**です。

- 馬具(手綱・鞍)のメタファー:強力だが制御しにくい「馬(モデル)」を、人間が望む方向に安全かつ効果的に導く仕組み全体。
- 別の比喩では「モデル = CPU/エンジン」「ハーネス = OS/車」。

ハーネスに含まれる主な要素:
- システムプロンプト / 指示階層(Priority Stack)
- ツール定義・管理・サンドボックス
- 記憶(短期作業記憶・長期意味記憶・エピソード記憶)
- Hooks(前後処理、承認ゲート、エラー処理)
- スキル・運用手順・規範的制約
- サブエージェントの協調ロジック
- **プロジェクトアーキテクチャ自体**(フォルダ構成、命名規則、型定義、テスト規約)
- Observability(トレース・ログ・評価)
- フィードバックループ・自己改善機構

モデルが賢くなっても、ハーネスが貧弱だと性能は大幅に低下します。逆に、同じモデルでもハーネスを改善するだけでベンチマーク順位が劇的に上がる事例(LangChainがTerminal BenchでTop30外→Top5になったケースなど)が複数報告されています。[[1]](https://x.com/tetumemo/status/2037876018745385083)

### 設計の核心原則

1. **Scaffolding is Temporary(足場は一時的)**
モデルが成長したら削除できる設計にすること。Anthropicは新しいモデルが出るたびに不要になった計画ステップや複雑なロジックを積極的に削除しています。

2. **Thin Harness vs Thick Harness**
- **Thin**(Anthropic寄り):モデルに多くを任せ、ハーネスはシンプルなループに留める。将来的にモデルが賢くなれば勝つ bet。
- **Thick**(LangGraph寄り):明示的なグラフ・フロー・検証ロジックをハーネスに持たせ、決定性を高める。
- 現実的には**ハイブリッド**が最も実用的。複雑な部分はグラフで制御し、創造的な部分はモデルに任せる。

3. **Predictability(予測可能性)を最大化**
エージェントが迷わないコードベースにする。明確なモジュール構成、強い型、規約、一貫したエラーハンドリングが非常に重要です。[[2]](https://x.com/xcanchal/status/2094802850383565152)

4. **Removability Test**
「より強力なモデルに置き換えたとき、ハーネスを複雑化せずに性能が上がるか?」を常に検証する。

### 実践的なハーネス設計の構成要素

**推奨技術スタック(2026年現在)**
- **オーケストレーション**: **LangGraph**(状態管理・チェックポイント・Human-in-the-Loopが最強)
- LLM抽象化: LiteLLM
- 観測性: LangSmith / Arize Phoenix / Helicone
- 記憶: 階層型(会話記憶 + ベクトル + 構造化ノート + 自動要約)
- ツール: MCP対応や**自動ツール生成**機能(ツールが存在しなければエージェント自身が書いてテストして登録)

**主要コンポーネント設計**

- **Agent Adapter Pattern**:様々なエージェント(Claude Code, Codex, 自作エージェントなど)を同一インターフェースで扱えるようにする。
- **Execution Engine**:ReAct / Plan-Execute-Reflect / Graphベースを切り替え可能に。
- **Memory System**:単なるRAGではなく、「何を記憶すべきか」を判断する仕組みを持つ。
- **Tool Harness**:原子的なツール設計 + 自動生成 + サンドボックス + 承認フロー。
- **Evaluation Harness**(分離推奨):Trajectory全体の評価(最終回答だけでなく過程も評価)。LLM-as-Judge + ルールベース + 人間フィードバック。
- **Architecture Layer**:`AGENTS.md`、`ARCHITECTURE.md`、規約を徹底。エージェントが「このプロジェクトはどういう構造か」を即理解できるようにする。

### すぐに始めるためのアクション

1. **最優先で読むべき資料**
@kinopeeeさんのSpeakerDeck「**ハーネス設計入門 〜プロンプト、コンテキストの次〜**」
→ https://speakerdeck.com/kinopeee/hanesu-sekkei-nyuumon-kontekisuto-no-tsugi
日本語で体系的に整理された現時点で最高の資料です。[[3]](https://x.com/MacopeninSUTABA/status/2094591568753922392)

2. LangGraphを使って最小ハーネスをプロトタイプ作成
3. 自分のユースケースを明確にする(コーディングエージェント、業務自動化、研究用ベンチマーク、個人用長期エージェントなど)

用途によって最適な厚みと構成が大きく変わります。

- コーディングエージェント → 強いプロジェクト規約 + 自動テスト + ファイルスナップショットが特に重要
- 業務自動化 → 承認フロー・監査ログ・サンドボックスが最優先
- 研究・ベンチマーク → 再現性と評価モジュールに重点

具体的に「どのような目的のエージェントハーネスを設計したいか」(例:ソフトウェア開発特化、社内業務自動化、研究用評価基盤など)を教えていただければ、より具体的なアーキテクチャ図やコード構成、コンポーネントの優先順位をお伝えできます。

この分野は2025〜2026年に急速に成熟しており、「ハーネス設計力」がこれからのAIエンジニアの差別化要因の一つになると考えられています。