**AIエージェント ハーネス設計(2026年最新プラクティス)**
2026年現在、AIエージェントの性能を決める最大の要因は「モデル」ではなく「ハーネス(Harness)」であるという認識が業界のコンセンサスになっています。
> 「The model is not the agent. The harness is.」
優秀なモデルを使ってもハーネスが弱いと信頼性は低く、逆に**ハーネスだけを最適化**しただけでSWE-benchが6.7%→68.3%に跳ね上がった事例が報告されています。モデルを大きくする前に、ハーネスを systematically に設計することが最もレバレッジが高いです。[[1]](https://x.com/beamnxw/status/2082746025958150333)
### 1. 設計哲学(最も重要)
#### Externalization(外部化)の原則
知能をLLMの重みやコンテキストウィンドウに閉じ込めない。以下の3つを外部化する:
- **Memory**:Working Context / Semantic / Episodic / Personalized Memory(それぞれライフサイクルが違う)
- **Skills**:Operational procedures、decision heuristics、normative constraints(タスク固有の「やり方」と「境界」)
- **Protocols**:Agent-User、Agent-Agent、Agent-Toolsの契約(失敗モードがそれぞれ異なる)
#### Mediators(仲介層)
上記とコアモデルの間に置く層:
- Sandboxing
- Observability
- Compression
- Evaluation
- Approval loops
- Sub-agent orchestration
新しい機能を追加するときに「それはMemoryに入れるべきか?Skillsか?Protocolか?Mediatorか?」と問う習慣が重要です。[[2]](https://x.com/akshay_pachaar/status/2045510648474530263)
#### Thick vs Thin Harnessの選択
- **Thin Harness**(Anthropic寄り):モデルに多くを任せる。モデルが賢くなればハーネスを削れる。
- **Thick Harness**(LangGraph寄り):決定論的グラフで厳密に制御。企業ユースではこちらが現実的。
- **現実的な落とし所**:最初は厚めに作り、モデル改善とともに徐々に薄くする(Scaffolding that disappears)。
Anthropicは積極的にplanningステップを削除し続け、OpenAIはcode-firstで構造を残し、LangGraphは明示的グラフを重視しています。
### 2. 推奨アーキテクチャ:ETCLOVG 7-Layer Harness
2026年で最も注目されているフレームワークです。[[3]](https://x.com/i/status/2082746025958150333)
1. **Execution Sandboxes**(実行サンドボックス層)
- すべての行動を隔離して実行
- 特にコード実行・ブラウザ操作・ファイル操作で必須
- ロールバック・リカバリ機構を必ず入れる
2. **Tool Protocols**(ツールプロトコル層)
- 統一インターフェース + スキーマ検証 + バージョン管理
- 各スキルに「contract」「versioning」「dedicated eval suite」を付ける
- 将来的にMCP(Model Context Protocol)的な発見性もここ
3. **Context State**(コンテキスト状態管理層)
- 記憶の種類ごとにバックエンドを分ける(Vector / Graph / KV Store)
- 自動圧縮機構
- 状態破損防止(long-running agentで最も頻発する失敗)
4. **Lifecycle Graphs / Orchestration**(ライフサイクル・オーケストレーション層)
- 実行ループの定義(ReAct、Plan-Execute-Verify、Hierarchicalなど)
- 停止条件、retry policy、escalation logic、sub-agent handoff
- ここが「厚いハーネス」の本体
5. **Observability**(可観測性層)← **最も重要**
- 完全なTrajectory(thought → action → observation)の構造化ログ
- Replay機能(任意の時点から再実行可能)
- リアルタイムダッシュボード + アラート
6. **Verifiers**(検証層)
- LLM-as-Judge + Rule-based + Consequence-based review
- 「Three-part blocker test」など具体的なチェックリスト
- Human-in-the-Loopのトリガールール
7. **Governance**(ガバナンス層)
- 権限管理、承認ワークフロー、予算・トークン制御
- ポリシーエンジン(後から交換可能に設計)
- 監査ログ・コンプライアンス
この7層を**疎結合**に設計することが成功の鍵です。将来的に各層をmicroservice化(イベントバス経由)するチームも増えています。
### 3. 実践的な設計ステップ
**Phase 1: 要求定義**
- 対象ドメイン(Coding / Web / Enterprise / Long-running)
- 許容失敗率と必要な信頼性レベル
- Human-in-the-Loopの閾値
**Phase 2: 最小ハーネス構築(おすすめ)**
多くの優秀なエンジニアが「最小の didactic なハーネス」を最初に自作しています。これによりフレームワークのブラックボックスを理解できます。
基本ループの骨格例:
```python
class AgentHarness:
def __init__(self):
self.sandbox = Sandbox()
self.memory = MemoryHierarchy()
self.verifier = Verifier()
self.observer = TrajectoryLogger()
self.governance = GovernancePolicy()
def run(self, task):
trajectory = []
while not self.should_stop():
observation = self.get_observation()
thought = self.model.think(observation, self.memory.get_context())
action = self.governance.validate(thought.action)
safe_action = self.sandbox.wrap(action)
result = self.sandbox.execute(safe_action)
verified = self.verifier.check(result, task.goal)
self.memory.update(result)
self.observer.log(thought, action, result, verified)
trajectory.append(...)
if not verified.ok:
if verified.needs_human:
self.escalate_to_human()
else:
self.recover(verified)
```
**Phase 3: 各層の強化**
- Observabilityを最初に本気で作る(後から追加すると地獄)
- Skillsを「再利用可能 + 評価可能」に設計
- 数千回の合成マルチターンシミュレーションで事前検証
### 4. 技術スタック例(2026年時点)
- **高速開発**:OpenAI Agents SDK + LangSmith
- **制御重視**:LangGraph(状態機として最高)
- **企業ガバナンス**:自前Harness + 独立したPolicy/Approval/Observabilityレイヤー
- **Observability**:LangSmith, Phoenix, OpenTelemetry for Agents
- **Sandbox**:専用ツール(agentosなど)
### 5. よくある失敗パターン
- モデルに過度に依存したThin Harness(モデルが変わると全部壊れる)
- 状態破損・レースコンディション(特に並列ツール呼び出し)
- ハーネスが肥大化してメンテ不能になる
- 評価が「最終結果」だけを見ていて、過程の失敗を捉えられない
---
**次のアクションとしておすすめ**
1. まず「最小の didactic ハーネス」を1週間で自作してみる(これが一番勉強になる)
2. ETCLOVG論文(https://openreview.net/pdf?id=3hXEPbG0dh)を精読
3. 具体的なユースケース(例:社内業務自動化エージェント、コード生成エージェント、長期監視エージェント)を教えてくれれば、その用途に特化した詳細設計図とコード構成をお渡しします。
必要であれば:
- 各レイヤーの詳細設計
- コード例(Python/LangGraph)
- 評価スイートの作り方
- 企業ガバナンス特化版
を深掘りします。どの方向を掘りたいですか?
X Learn [2026-07-31] AIエージェント ハーネス 設計