Hermes Agentとは:既存フレームワークとの違い・活用例・拡張方法
この記事で学べること
- Hermes Agentの「自己改善」が保存する情報と、次回に再利用する手順
- 完成した作業環境として使うHermes Agentと、開発用の枠組みから組み立てる方法の違い
- 定期レポート、開発運用、チームの知識共有へ適用する方法
- 拡張方法と、組織で利用する前に確認する権限・記録・承認の条件
Hermes Agentは記憶・定期実行・メッセージ連携を統合した作業環境
Hermes Agentは、記憶、再利用手順、定期実行、メッセージ連携、隔離実行をまとめたオープンソースの作業環境です。毎週同じ情報を集めて報告する仕事では、会話だけでなく、前回の決定を覚え、手順を再利用し、決まった時刻に動いて結果を届ける仕組みが必要です。完成した作業環境から始めるか、自社向けの開発用部品から組み立てるかが、導入方法を分ける中心的な判断です。
この記事では、「Hermes Agentは開発フレームワークと何が違い、どこから試すべきか」という問いに焦点を当て、公開情報から確認できる役割、作業の流れ、導入時の判断材料を扱います。
最後まで読むと、「Hermes Agentは開発フレームワークと何が違い、どこから試すべきか」という問いを、自分の状況に照らして判断するための材料を持ち帰れます。
Hermes Agentの自己改善はモデル再学習ではなく記憶と手順の再利用を指す
Hermes Agentの「自己改善」は、過去の会話や作業手順を次回の実行で再利用できる形に残す仕組みです。Shubham Saboo氏のLinkedIn投稿では、この記憶とスキル化が紹介されています。[1] Nous ResearchはHermes Agentをオープンソースのエージェントハーネス(AIが継続して作業するための実行環境と運用の仕組み)と位置づけています。複数のモデルプロバイダー、メッセージサービス、定期実行、サブエージェント(主担当から分かれて限定された仕事を行うAI)、隔離されたターミナル環境を一つの実行基盤へまとめています。[2]
ここでいう「自己改善」は、AIモデル自体の追加学習ではありません。Hermes Agentは、再利用する事実や利用者の好みを専用ファイルへ保存し、過去の会話を全文検索できるデータベースへ記録します。[3] 長い手順は別の手順書として保存し、必要なときだけ読み込みます。[4]
この記事ではHermes Agentの自己改善を、会話や実行結果から得た知識を、次回のプロンプトや手順書へ反映する運用上の学習ループと定義します。モデルの重みは自動更新されません。改善の質は、保存内容の正確さ、承認方法、再評価の手順に左右されます。
Hermes Agentは依頼受付・実行・知識保持・自動化・拡張を一体化する
構成は次の5層に分けられます。この分類は公式アーキテクチャを基にした本記事独自の整理です。[5]
| 層 | 主な構成要素 | 担う役割 |
|---|---|---|
| 依頼を受ける場所 | 文字で操作する画面、デスクトップ画面、メッセージ連携、外部接続 | 人や外部システムから依頼を受ける |
| 作業を進める場所 | AIの反復処理、道具、役割を分けた補助AI、コマンド実行 | 考える、道具を使う、複数作業を同時に進める |
| 知識を残す場所 | 記憶、過去の会話検索、再利用手順、プロジェクト規約 | 好み、過去の会話、再利用手順、守るルールを保持する |
| 自動で始める仕組み | 指定時刻、外部からの通知、画面を閉じても続く処理、結果配信 | 時刻や出来事をきっかけに作業し、結果を届ける |
| 機能を追加する仕組み | 外部ツールとの共通接続、追加機能、外部の記憶、別のAIモデル | 社内システム、追加ツール、別モデルへ接続する |
この構造の利点は、AIを自社アプリケーションへ組み込む前に、完成した作業環境として試せることです。一方で、各層に最初から決められた動作があります。仕事の進行状態や、誰が何を操作できるかをコードで細かく決めたい場合は、部品から作る開発用の枠組みと比べて、どこまで変更できるかを確認する必要があります。
Hermes Agentは完成した作業環境、既存フレームワークは開発用の部品から始まる
比較では、誰がエージェントの実行ループと運用面を組み立てるかを見ます。Hermes Agentは利用可能なエージェント環境を先に提供します。LangGraph、CrewAI、AutoGen、OpenAI Agents SDK、Google ADK、Claude Agent SDKは、開発者が自社アプリケーションの中へエージェントを組み込むための枠組みです。
ここで「GeminiのAgent SDK」は、Googleが公開する正式名称**Agent Development Kit(ADK)**を指します。ADKはGeminiだけに閉じたSDKではなく、エージェント、ツール、予測可能なワークフロー、動的なルーティング、評価、複数のデプロイ先までを扱うオープンソースの開発フレームワークです。[10] 一方、Claude Agent SDKは、Claude Codeを支えるエージェントループ、コンテキスト管理、ファイル操作やコマンド実行などのツールをPythonまたはTypeScriptのライブラリとして提供し、権限、hooks、サブエージェント、MCP、セッションもコードから制御します。[11]
| 選択肢 | 最初から用意される考え方 | 利用側が設計する範囲 | 向いている場面 |
|---|---|---|---|
| Hermes Agent | 継続稼働に必要な機能をまとめた作業環境 | 用途別設定、ツール権限、手順、記憶、自動化、配信先 | 個人またはチームの作業支援、常時稼働するAI、社内業務の試行[2][5] |
| LangGraph | グラフと状態を中心にした低レベルのオーケストレーション | ノード、遷移、永続化、人の介入、アプリケーションUI | 長時間・状態依存の業務フローを明示的に制御するシステム[6] |
| CrewAI | 役割を持つAgents、Crews、イベント駆動のFlows | 役割分担、タスク、処理順序、状態、デプロイ | チーム型のマルチエージェントと業務フローをPythonで構築する場合[7] |
| AutoGen | 会話するAgentsとAgent Runtime | メッセージ、チーム構成、実行環境、エージェントのライフサイクル | 会話型・イベント駆動のマルチエージェントを柔軟に研究・開発する場合[8] |
| OpenAI Agents SDK | AI、実行役、道具、別のAIへの引き継ぎ、安全上の制限、会話単位 | AIの役割、委譲、安全上の制限、自社アプリとの接続 | 少ない構成要素でOpenAI中心のAIアプリを作る場合[9] |
| Google Agent Development Kit(ADK) | Agents、tools、workflow agents、マルチエージェント | エージェント階層、順次・並列・反復処理、動的ルーティング、評価、デプロイ | GeminiやGoogle Cloudとの統合、評価を含むマルチエージェント基盤を構築する場合[10] |
| Claude Agent SDK | Claude Codeのエージェントループ、組み込みツール、コンテキスト管理 | プロンプト、ツール、権限、hooks、セッション、サブエージェント、実行基盤 | ファイル、コマンド、Web、MCPを使うClaude中心の開発・調査エージェントを製品へ組み込む場合[11] |
対話画面、メッセージ配信、定期実行、前回までの情報を残す機能を含む「利用可能な環境」から始めやすい点がHermes Agentの特徴です。ADKは作業の流れ、評価、Google Cloudへの公開方法まで広く設計したい場合、Claude Agent SDKはClaude Code相当のツール実行を自社の仕事へ組み込み、権限や承認をコードで管理したい場合に適します。どれを選んでも、利用者向け画面、自動処理の管理、会社や部署ごとのデータ分離、秘密情報の管理、操作記録をどこまで自社で用意するかは別途確認します。
他の選択肢と組み合わせることもできます。たとえば、顧客向けの厳密な業務フローをLangGraphで実装し、そのAPIをMCP(Model Context Protocol、AIと外部ツールを接続する共通規格)としてHermes Agentへ公開できます。外側の対話、定期実行、記憶はHermes Agentが担当し、重要な状態遷移と承認は業務アプリケーション側で管理する構成です。
活用例は「試しやすいか」と「効果を測れるか」で見る
公式ドキュメントには、週次レポート、GitHubリポジトリ監視、Webページの変更検知、バックログ整理などの自動化例があります。[12] コミュニティ事例集には、会議の文字起こしをTeamsから操作する例、ツール呼び出しをSQLiteへ記録してGrafanaで可視化する例、複数の専門プロファイルを分ける例などが掲載されています。[13]
後者は利用者から寄せられた報告を集約したものであり、独立した効果検証ではありません。導入判断では、公開事例を実現可能性の参考にし、自社の品質、費用、所要時間を別に測定する必要があります。
週次インテリジェンスレポート
検索対象、評価条件、出力形式、配信先を自己完結したプロンプトへまとめ、毎週決まった時刻に実行します。Hermes Agentのcronは新しいセッションでジョブを実行するため、「前回と同じ条件」のような省略を避け、対象と判断基準をプロンプトまたは添付スキルに固定します。[12]
適するのは、複数の情報源を検索し、人が読む短い要約へ編集する作業です。APIの値を取得して閾値を超えたときだけ通知する処理なら、LLMを使わない通常のスクリプトの方が安定し、費用も予測しやすくなります。
開発バックログの一次整理
GitHubのissueを読み、緊急度、分類、最初の対応案をまとめてチームのチャネルへ送ります。自動でラベル変更やissueの終了まで行うのではなく、最初は読み取りと提案だけに限定すると、誤操作の影響を抑えながら評価できます。
この例では、毎回変わらない分類基準をスキルへ置き、GitHubとの接続は必要な読み取りツールだけを許可したMCPサーバーへ分けます。人が提案を確認してから更新系ツールを追加すれば、権限を段階的に広げられます。
繰り返し作業をチームの手順へ変換
調査、障害切り分け、定型レポートなどで有効だった手順をスキルとして保存し、次回の作業で再利用します。Hermes Agentはスキルを作成・修正できますが、企業環境では自動更新をそのまま共有手順へ反映しない方が安全です。スキル書き込みの承認を有効にし、差分レビュー、検証、版管理を通した後にチームへ配布します。[4]
活用は最小構成から段階的に広げる
個人検証では、公式のインストーラーと対話型セットアップで開始できます。インストールスクリプトを直接実行する方法も案内されていますが、企業環境では内容を取得してレビューし、承認した版を社内配布する方法へ置き換えます。[14]
# 個人検証用の公式クイックスタート例
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
hermes setup
hermes chat最初の検証は次の順で進めます。
- 1つのモデルと通常のチャットだけを動かす
- 読み取り専用ツールを1つ追加する
- 評価用の定型タスクを10〜20件用意し、成功条件と費用を記録する
- メモリとスキルの書き込みを承認制で有効にする
- cronまたはメッセージ連携を1つ追加する
- 書き込み操作は人の承認と隔離環境を確認してから試す
10〜20件という件数は製品仕様ではなく、本記事が提案する小規模パイロットの開始点です。件数を増やすより、入力条件、期待結果、許容しない操作、再試行回数、費用上限を先に固定する方が比較しやすくなります。
何を変えたいかで拡張方法を選ぶ
拡張機構は役割が重なる部分もありますが、変更対象で分けると判断しやすくなります。
| 拡張方法 | 追加するもの | 適用例 | 主な確認点 |
|---|---|---|---|
| 前提を伝えるファイル | プロジェクトのルールと前提 | AGENTS.mdでテスト方法や編集禁止範囲を伝える | 指示であり、技術的に操作を強制停止する仕組みではない[15] |
| 再利用する手順書 | 繰り返し使う長い手順 | 障害の原因調査、レポート作成、確認基準 | 自動更新の承認、版管理、効果確認[4] |
| 外部ツールとの共通接続(MCP) | 外部サービスを操作する道具 | GitHub、社内サービス、データベース | 公開する操作の絞り込み、接続情報、読み書き権限[16] |
| プラグイン/hook(特定イベントの前後に自動処理を動かす仕組み) | 実行時のツール、イベント処理、CLI機能 | 監査ログ、独自コマンド、外部メモリ | 任意コードの審査、依存関係、更新方法[17] |
外部サービスとの共通接続(MCP)は、既存の社内サービスをHermes Agentへつなぐ方法です。次の例では、manualが危険なコマンドを人の確認待ちにし、write_approvalが記憶と手順書の変更を確認待ちにします。backend: dockerは作業場所を端末から分離し、includeはGitHubで利用できる操作を課題の一覧取得と詳細確認だけに絞ります。[16] GitHubへ接続する認証情報は、組織で承認した秘密情報の管理方法で設定し、設定ファイルを版管理へ追加しないでください。
# ~/.hermes/config.yaml の組織内パイロット向け例
approvals:
mode: manual
cron_mode: deny
memory:
write_approval: true
skills:
write_approval: true
terminal:
backend: docker
mcp_servers:
github:
command: "npx"
args: ["-y", "@modelcontextprotocol/server-github"]
env:
GITHUB_PERSONAL_ACCESS_TOKEN: "***" # 承認済みの認証情報へ置き換える
tools:
include: [list_issues, get_issue]
prompts: false
resources: falseこの設定は、危険なコマンドと、記憶・再利用手順の変更を人の確認待ちにし、コマンドの実行場所をDockerへ分離し、GitHubで使える操作を読み取り中心に絞る出発点です。prompts: falseとresources: falseは、GitHub接続から追加の指示や資料閲覧機能を受け取らない設定です。隔離環境や承認設定だけで安全性が保証されるわけではなく、ネットワーク、端末の権限、認証情報、接続先サービス側の利用権限も別に設計します。
組織利用では実行環境の機能と自社の統制を分けて確認する
この節は筆者による企業導入の経験談ではありません。公式資料に記載された機能と、一般的なセキュリティ・運用上の確認事項を整理したものです。実際の導入要件は、所属組織のセキュリティ、法務、IT運用、利用部門と確認してください。
安全面では、コマンド承認、メッセージ利用者の許可リストとペアリング、ファイル書き込み制限、Dockerなどの隔離実行、MCPの環境変数フィルタリング、Webアクセス制限が用意されています。[18] ただし、公式資料もファイル書き込みガードを完全なサンドボックス(プログラムが触れられる範囲を技術的に閉じる実行境界)ではないと説明しています。ターミナルは同じOS利用者の権限で別経路からファイルへアクセスできるためです。[18]
組織利用ではデータ・権限・監査・費用・保守体制を確認する
| 領域 | 合格条件 | 確認方法 |
|---|---|---|
| データ | 入力、会話履歴、記憶、手順書、操作記録の保存場所と期間が決まっている | AIへの送信先、保存場所、バックアップ、削除手順を情報の流れの図へ記録する |
| 利用者と権限 | 個人または役割ごとの利用者、配信先、承認者が特定できる | 利用許可リスト、端末との接続、AI用の接続情報、外部ツール側の権限を一覧にする |
| 実行場所の分離 | AIが業務端末や本番環境を直接操作しない | 管理者権限を持たない隔離環境、作業場所、処理能力とネットワークの上限を設定する |
| 学習内容 | メモリとスキルの変更を人が確認し、誤った知識を戻せる | write_approval、差分レビュー、版管理、ロールバックを有効にする |
| ツール | 各用途に必要な最小操作だけを公開する | MCPのinclude、更新・削除権限、並列実行時の競合を確認する |
| 監査と評価 | 誰が、いつ、どのモデルとツールを使い、何が変わったか追跡できる | セッション、ツールログ、費用、出力、承認記録を共通IDで関連づける |
| 変更管理 | 更新版と依存関係を検証してから展開できる | 版を固定し、検証環境、バックアップ、段階展開、復旧手順を用意する |
用途別プロファイルは、設定、APIキー、メモリ、セッション、スキル、cron、状態DBを別ディレクトリへ分離します。[19] この分離だけでは、組織のSSO、RBAC(役割に基づくアクセス制御)、職務分離、データ保持ポリシーを満たしません。既存のID基盤、秘密管理、SIEM(セキュリティログを集約・分析する仕組み)、変更管理への接続は別に確認します。
ダッシュボードにはセッション履歴から計算したトークン(モデルが処理する入力と出力の情報量の単位)、費用、キャッシュ利用率などの分析画面があります。[20] これらは運用量の把握には使えますが、業務品質の評価には、正答率、禁止操作、承認回数、手戻り、完了条件を用途ごとに追加します。利用期間の長さだけでは、業務成果を示せません。
Hermes Agentを選ばない方がよい条件
次の条件では、既存のワークフロー基盤や低レベルのフレームワークが適する場合があります。
- 入力と出力が固定され、通常のスクリプトやRPAで再現できる
- 状態遷移、再試行、補償処理、承認経路をコードで厳密に証明する必要がある
- 顧客向けアプリケーションへ独自UIとマルチテナント権限を組み込みたい
- 会話履歴や学習内容を長期保存できず、継続メモリの価値が小さい
- 社内標準の監視、評価、SSO、監査へ接続する方法を確認できていない
自由度の高い個人エージェントを、そのまま全社配布することは避けます。明確な1用途、限定されたデータ、読み取り中心の権限、測定可能な完了条件から始めてください。
まとめ:Hermes Agentは一つの定型業務と読み取り専用ツールから試す
継続メモリ、再利用可能なスキル、定期実行、メッセージ連携、複数の実行環境が一つにまとまっています。LangGraphやAgents SDKの代替ではなく、すぐに利用できるエージェント環境として比較すると違いが明確になります。
試用では、1つの定型業務と読み取り専用ツールから始め、品質、費用、禁止操作を測ります。拡張ではコンテキスト、スキル、MCP、プラグインの責任を分けます。本番導入前に、メモリとスキルの書き込み承認、実行分離、最小権限、ログ、評価、更新管理を確認してください。
本記事は一般的な情報整理であり、法的助言ではありません。実務判断は専門家に確認してください。
参考文献
- Shubham Saboo, Introducing Hermes Agent: Open-Source AI Teammate, LinkedIn, 2026
- Nous Research, Hermes Agent Documentation, 2026
- Nous Research, Persistent Memory, 2026
- Nous Research, Skills System, 2026
- Nous Research, Architecture, 2026
- LangChain, LangGraph overview, 2026
- CrewAI, CrewAI Documentation, 2026
- Microsoft, AgentChat, AutoGen, 2026
- OpenAI, Agents, OpenAI Agents SDK, 2026
- Google, Agent Development Kit(ADK), 2026
- Anthropic, Agent SDK overview, Claude Agent SDK, 2026
- Nous Research, Automate Anything with Cron, 2026
- Nous Research, User Stories & Use Cases, 2026
- Nous Research, Quickstart, 2026
- Nous Research, Context Files, 2026
- Nous Research, MCP (Model Context Protocol), 2026
- Nous Research, Plugins, 2026
- Nous Research, Security, 2026
- Nous Research, Profiles: Running Multiple Agents, 2026
- Nous Research, Web Dashboard, 2026
最新のリリースやアップデートの詳細は、公式サイト・公式ドキュメントを確認してください。