**AIエージェント ハーネス設計**(2026年現在のベストプラクティス)

### 1. AIエージェントにおける「ハーネス」とは

**ハーネス**とは、LLMを「薄い知能(thin model)」として扱い、その周囲に**制御・記憶・スキル・監視・安全・回復機構**を包括的に構築した実行ランタイムです。

近年、最も重要な考え方の転換は以下の通りです:

> 「モデルを強くするより、ハーネスを賢く設計せよ」

同じモデルを使っても、ハーネスの質で性能が**14.5%〜88%**変わるという結果が複数の論文・実践で示されています。企業では「The Harness, Not the Agent(エージェント本体ではなく、ハーネスが本質)」という認識が広がっています。[[1]](https://x.com/v_shakthi/status/2089340732020789370)

### 2. 推奨アーキテクチャ(Inverted Intelligence)

従来の「LLMにツールをくっつける」考え方ではなく、**知能の大部分をハーネスに外部化**します。

#### 中心となる3つの軌道(Orbiting Modules)

- **Memory Layer**(記憶)
- Working Memory(現在のタスクコンテキスト)
- Semantic Memory(知識グラフ / Vector Store)
- Episodic Memory(過去の軌跡・経験)
- Personalized / Long-term Memory

- **Skills Layer**(スキル)
- Procedural Playbooks(運用手順)
- Decision Heuristics(意思決定ルール)
- Normative Constraints(企業ポリシー・行動規範)

- **Protocols Layer**(プロトコル)
- Agent ↔ User(承認フロー)
- Agent ↔ Agent(マルチエージェント協調)
- Agent ↔ Tools(厳格なスキーマ定義)

#### Mediator Layer(仲介層)※最も重要な部分

- Sandboxing & Execution Control
- Observability / Tracing / Logging
- Context Compression & Pruning
- Evaluation / Scoring / Critic
- Human-in-the-Loop(承認ループ)
- Sub-agent Orchestration
- Safety Guardrails & Recovery

これらの仲介層が「どのように状態を流すか」「どこまで許可するか」「失敗時にどう復旧するか」を決定します。[[2]](https://x.com/akshay_pachaar/status/2045510648474530263)

### 3. システム全体像(Mermaid)

```mermaid
graph TD
subgraph Harness [AI Agent Harness Core]
Loop[Orchestration Loop
ReAct + MEA + Hierarchical]

subgraph Orbits [Intelligence Orbit]
Memory[Memory Layer
Working / Semantic / Episodic]
Skills[Skills Layer
Playbooks + Heuristics]
Protocols[Protocols Layer
Contracts]
end

subgraph Mediators [Mediators]
Sandbox[Sandbox + Tool Executor]
Observe[Observability + Tracing]
Safety[Safety Guardrails + Evaluator]
Orchestrator[Multi-Agent Orchestrator]
HIL[Human-in-the-Loop Approval]
Recovery[Recovery & Rollback]
end
end

Task[Task Input] --> Loop
LLM[Thin LLM] <--> Loop
External[External Tools / APIs] <--> Sandbox
User[User / Auditor] <--> HIL

Loop <--> Memory
Loop <--> Skills
Loop <--> Protocols
Loop <--> Mediators
```

### 4. 重要な設計原則

| 原則 | 内容 | 具体的な実装例 |
|------|------|---------------|
| **Controllability** | 制御可能性を最優先 | 明示的な状態管理(LongHorizon-Harness方式) |
| **Observability** | 全てを可視化 | Trajectoryログ + LangSmith/OpenTelemetry |
| **Safety by Design** | 6フェーズ評価 | 設定・拡張・実行・状態・行動・復旧(HarnessRiskベンチマーク) |
| **Modularity** | 交換可能性 | 「置換代数」+プラグインアーキテクチャ(HarnessX, DeepSeek Harness) |
| **Evolvability** | 進化可能性 | AEGISのような自動改善エンジン |

**安全性に関する最新知見(2026年)**:
- HarnessRiskベンチマークでは、**設定フェーズ**が最も脆弱。
- 同一モデルでもハーネスによってAttack Success Rateが**4倍以上**変わる。
- 正常タスクの成功率が高いまま、隠れた悪意ある指示を実行されてしまうケースが多い。[[3]](https://x.com/AnandButani/status/2091616599463612598)

### 5. 実装アプローチの選択肢

**A. 既存フレームワークを活用(推奨スタート)**
- **LangGraph**:状態機械として現時点で最強
- LlamaIndex Workflows + LlamaParse(ドキュメント処理に強い)
- CrewAI + 強力なobservability

**B. ゼロからミニマルハーネスを構築**
- Vercelの「Build an AI coding agent harness from scratch」が非常に参考になる
- ツールループ、コンテキスト剪定、サンドボックス、評価ループを一から実装して理解を深める

**C. 企業生産グレード**
- 権限管理、監査ログ、サーキットブレーカー、自動ロールバック
- 「everything is a plugin」思想(DeepSeek Harnessなど)

### 6. 今後の方向性

- ハーネス自体を**進化させるシステム**(HarnessX + AEGIS型)
- 長期タスク向けの**明示的状態管理 + MEAループ**(Manage-Execute-Audit)
- モデル非依存の「Code as Harness」アプローチ

---

この設計で作れば、「デモで動くAgent」ではなく「本番で信頼できる、監査可能で安全なAgentシステム」が実現できます。

**さらに深掘りが必要な部分があれば教えてください**:
- 具体的なLangGraph実装例
- Safety Guardrailsの詳細設計
- 評価・進化エンジンの作り方
- 企業ガバナンス向けの権限・監査設計
- ミニマルハーネスのコードスケルトン

必要に応じて詳細な設計書やアーキテクチャ図を追加で作成します。