← 逆流而上
Wudelay

Hermes Agent 怎麼用?它在幹嘛、跟其他 AI 助理差在哪

Wudelay AI 2026-09-0915 分鐘的航程

Hermes Agent 是什麼?自架 AI 助理的完整解析

先給答案:其他 AI 助理是你打開它、用完關掉;Hermes Agent 是它一直開著、住在你自己的機器上,你從 Telegram 傳一句話就能叫它,而它累積下來的東西——對你的理解、做過的流程、記住的事——連同跑這一切的程式本身,全部在你手上。

Hermes Agent 是 Nous Research 開源的 AI agent 框架,MIT 授權。它最容易被誤解的一點是:它本身沒有腦,要接一個模型才會動。所以「它跟 Claude 誰比較聰明」這個問題問錯了——聰明程度取決於你接哪個模型;Hermes 決定的是這個助理住在哪、什麼時候動、記得什麼。

最特別的地方:四個決定權

把 Hermes Agent、Claude Code、Codex 攤開比,功能清單其實重疊很多——記憶、技能、子代理、排程,三邊都有。真正分得開的是四件事:用哪個模型、程式在哪台機器上執行、從哪裡叫它、以及跑這一切的程式本身在不在你手上。

三者的功能清單重疊很多,真正分得開的是這四件事由誰決定。「官方文件未載明」是照實記錄,不是推測。
三者的功能清單重疊很多,真正分得開的是這四件事由誰決定。「官方文件未載明」是照實記錄,不是推測。

有兩格要補充,免得看起來像在拉偏架。Claude Code 也會自動累積記憶,差別在「技能」這一層——就官方文件所載,它的技能是你自己寫的檔案,不會在使用過程中自己長出來。另外,Claude Code 確實能部署到 Amazon Bedrock、Google Cloud 的 Agent Platform 或 Microsoft Foundry,但那改變的是帳單開在誰那裡、資料流經哪個雲,跑的仍然是 Claude 模型;Hermes 換掉的是模型本身。這是兩件不同層次的事,很多比較文章會混在一起講。

這四項加起來會導向同一個後果,那才是它真正特別的地方:你累積的東西,連同讀得懂這些累積的那個程式,都留在你手上。記憶與技能在哪個工具裡都是檔案,本來就能複製走;差別在跑這些檔案的執行體。商業產品的執行體不在你手上,它改版、改價、或哪天收掉,你手上的檔案就沒有東西可以拿來跑。Hermes 的執行體是 MIT 授權、裝在你機器上的程式,換掉底下的模型不需要改任何設定。

代價當然存在,而且不小,後面有一整節專門講。但先把「它到底在幹嘛」講清楚,判斷才有意義。

它每天在幹嘛:三個具體畫面

以下三個情境是舉例,不是官方案例。用到的能力都是官方文件載明的——內建排程、把結果投遞到通訊軟體、跨平台共用同一份脈絡、任務做過就自動存成技能——只是組合成一個經營品牌的人會遇到的樣子。

畫面一:早上七點,訊息已經在手機裡

你設一個排程:每天早上七點,去看網站前一天的自然搜尋流量、列出掉出前十名的關鍵字,整理成一則訊息推到你的 Telegram。你醒來時它已經躺在手機裡,不需要你打開電腦,也不需要你開口問。

Hermes 內建 cron 排程器,可以把結果投遞到任何一個已經接上的平台。要提醒的是:排程與投遞是它內建的,資料來源要你自己接——它能不能讀到你的流量數據,取決於你在 hermes tools 開了哪些工具,以及有沒有給它對應的金鑰。這一步是自架方案裡最常被低估的工。

畫面二:在捷運上接續昨天的事

你想到一個貼文題目,用 Telegram 丟一句「昨天那個 SEO 系列的第三篇,標題再想五個」。它不需要你重新交代前情,因為 Telegram、Slack、終端機走的是同一個 gateway 行程、同一份記憶。回到家打開電腦,同一條脈絡還在那裡。

這跟「在手機上開一個 AI app」是不同的事。手機 app 給你的是同一個服務的另一個入口,對話從零開始;這裡給你的是同一個助理的另一個入口——它中間沒有停過。

畫面三:做過一次,下次就變一句話

第一次請它把一篇草稿變成網站上排版好的文章,它要做很多步:讀檔、轉成 HTML、檢查標題階層、上傳圖片、建立草稿。這一趟用掉的工具呼叫遠超過五次,於是它自動把整個過程寫成一份可重用的技能文件。

下次你只要說「照上次那樣發一篇」,它調出那份技能,不用你再交代一次流程。如果中途發現流程裡有一步已經過時,它會當場把那份技能修掉。

這三個畫面有一個共同點:都不是「你坐在電腦前跟它聊天」。這是它跟一般 AI 助理最直觀的差別——你不是去它那裡用它,是它一直在那裡等你。

它憑什麼做得到:三個設計

先講一件會影響後面所有理解的事:Hermes 本身不含模型。把它放進整個堆疊裡看比較清楚。

Hermes Agent 站在最上層,本身不含模型。它決定的不是「多聰明」,而是「怎麼動、記得什麼」。
Hermes Agent 站在最上層,本身不含模型。它決定的不是「多聰明」,而是「怎麼動、記得什麼」。

模型權重決定它有多聰明,推論引擎決定它跑得多快,而 Hermes 站在最上面一層,決定要呼叫哪些工具、按什麼順序做、什麼值得記下來。裝好之後的第一件事,就是用 hermes model 指定它接哪個模型;官方支援 Nous Portal、OpenRouter、OpenAI 與你自己的端點,切換不需要改任何程式碼。想把第一、二層也搬到自己機器上,那是另一個題目,地端模型那篇拆得比較細。

設計一:技能會自己長出來

這是畫面三背後的機制。它不是一個功能,是一個閉環。

「五次工具呼叫」是官方載明的門檻:一件事只要複雜到需要來回操作,就值得被記下來,不必等你開口說「存成流程」。
「五次工具呼叫」是官方載明的門檻:一件事只要複雜到需要來回操作,就值得被記下來,不必等你開口說「存成流程」。

「五次工具呼叫」這個門檻最能說明設計意圖:它假設一件事只要複雜到需要來回操作,就值得被記下來,而不是等使用者主動說「把這個存成流程」。除此之外還有兩個環節在背景跑——一個整理機制會定期檢視自己產生的技能,合併重疊的、封存過期的,並保護被標記為固定的項目;另外,agent 整理過的事實會寫進 MEMORY.md,並有週期性提示提醒它把值得留下的東西寫進去。過去的對話則可以全文搜尋再由模型摘要,不會因為換了一個對話視窗就失憶。

誠實地說,這套機制的價值高度取決於使用強度。偶爾用一下,它累積不出什麼;長期處理重複性高的工作,累積才開始有意義。這不是誰比較強的問題,是設計給不同的使用節奏。

SOUL.md:這個助理是誰

Hermes 用幾個檔案分工管理脈絡,其中最特別的是 SOUL.md:它放的是身分、語氣、溝通風格,而且佔據系統提示的第一個位置,官方文件稱之為「agent identity position」。

它跟專案設定檔的分工,官方給了一個很好用的判準:會跟著你到任何地方的,放 SOUL.md;只屬於某個專案的,放 AGENTS.md。

有個實作細節值得先知道:SOUL.md 只會從 Hermes 的家目錄(預設 ~/.hermes/SOUL.md)載入,不會去搜尋你當前所在的資料夾。所以它是「這個助理」的設定,不是「這個專案」的設定。

設計二:一個 gateway 接所有入口

這是畫面二背後的機制。Hermes 用單一個 gateway 行程同時接 Telegram、Discord、Slack、WhatsApp、Signal、Email 與命令列,各平台共用同一份對話脈絡與記憶。

這帶來的不只是「多一個入口」,而是 agent 變成持續存在的:它會在你不在的時候跑排程、累積對你的理解;你從哪個平台丟話進去,接上的都是同一條脈絡。搭配內建的 cron 排程器,才有畫面一那種「早上七點自己出現」的效果。

代價也很直接:你要有一台一直開著的機器,而且必須自己決定誰可以對它下指令。這兩件事下一節會展開。

設計三:程式在哪台機器上執行,你自己選

agent 要執行程式碼,就必須決定「在哪裡執行」。Hermes 把這件事做成可選的,GitHub 的 README 列出七種執行後端,構成一條從「完全在自己機器上」到「完全交給第三方」的光譜。

七種執行後端排成一條光譜。位置是依「離自己的機器有多遠」分類,不是效能數值;一般人只會用到左邊三格。
七種執行後端排成一條光譜。位置是依「離自己的機器有多遠」分類,不是效能數值;一般人只會用到左邊三格。

實際上一般人只會用到左邊三格。本機最單純,就是直接跑在這台電腦上;Docker 多一層容器隔離,是比較穩妥的預設——agent 會執行程式碼,關在容器裡出事的範圍比較小;SSH 是你自己租的遠端主機。右邊的 Modal、Daytona、Vercel Sandbox 是第三方託管的沙箱環境,好處是閒置時幾乎不花錢,但程式碼就是在別人的機器上跑;Singularity 則是高效能運算叢集在用的容器格式,一般人碰不到。

選哪一種,就決定了程式碼與資料實際在誰的硬體上被執行。這跟地端模型的核心判準是同一件事——看運算實際發生在哪台機器上,不要看工具叫什麼名字。安全面上,容器有做基本強化:唯讀根目錄、移除多餘的權限、限制行程數量。這是工具給的底線,不是替你做完一整套安全設計。

怎麼用:從零到第一個排程

大部分教學到「安裝指令」就結束了,但問題正是從那裡開始。完整的路徑長這樣:

從零到「它會自己在早上七點出現在你手機裡」的完整路徑。多數教學只講到第二步。
從零到「它會自己在早上七點出現在你手機裡」的完整路徑。多數教學只講到第二步。

第一步:裝之前先決定三件事

機器。它要一直開著才有意義。三個選項:先用自己的電腦最省事,但關機它就停,適合拿來試;家裡的小主機或 NAS 一直開著、電費低;再來才是租 VPS,README 給的參考點是「一台每月五美元的 VPS」等級——如果模型走雲端 API,agent 本身很輕,這個等級夠用。有件事要先知道:筆電闔蓋休眠,排程就不會跑,那不是 Hermes 的問題,是機器睡著了。

腦。接雲端 API 最快,要先準備該供應商的金鑰;接自己機器上的模型則門檻由模型決定,是另一個量級的問題。

入口。建議先只用終端機,確定自己會用了再接通訊軟體。接通訊軟體之前,一定要先想清楚誰可以對它下指令。

第二步:安裝

Linux、macOS、WSL2 與 Termux:

curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

Windows 用 PowerShell:

iex (irm https://hermes-agent.nousresearch.com/install.ps1)

相依套件是 Python 3.11、Node.js、ripgrep 與 ffmpeg,安裝腳本會處理;Windows 上會另外附一份可攜版的 Git Bash,不需要管理員權限。這兩行都是「下載一段腳本直接執行」,執行前先把網址打開看一眼內容,是基本的謹慎。

裝完之後的常用指令:

指令 用途
hermes 啟動互動式介面
hermes setup 完整設定精靈
hermes model 選擇模型供應商與模型
hermes tools 設定要啟用哪些工具
hermes gateway 啟動訊息 gateway
hermes doctor 診斷安裝問題
hermes update 更新到最新版

第三步:讓它認識你

這一步最常被跳過,但它決定了之後每一次對話的品質。打開 ~/.hermes/SOUL.md,寫進三件事:你是誰、在做什麼;希望它用什麼語氣;有什麼是它不該做的。

判準就是前面那一句——會跟著你到任何地方的寫在這裡,只屬於某個專案的寫進那個專案的 AGENTS.md。花十分鐘寫這份檔,比之後每次對話重講一遍划算。

第四步:接上手機

gateway 是一個行程,同時服務所有平台。以 Telegram 為例,順序是先在 Telegram 那邊建一個 bot 拿到 token(這是 Telegram 的規則,不是 Hermes 的),再把 token 交給 Hermes;hermes setup 這個設定精靈會帶你走完平台設定這一段。

這一步有個不能省的動作:設定誰可以對它下指令。一個能執行程式碼、握有你所有記憶的 agent,如果掛在一個誰都能傳訊息的機器人上,等於把你的終端機開放給任何找得到它的人。允許清單設好之後,再實際用另一個帳號測一次會不會被擋掉。

第五步:設第一個排程

第一個排程請做一件無害的事——例如每天固定時間回報某個網址還活著——先確認它真的會準時出現在你手機上,再把真正的工作交給它。排程是這整套東西真正開始有價值的地方,也是最容易靜悄悄失效的地方。

另外先想好三件事:怎麼確認它還活著(hermes doctor 可以診斷安裝問題;gateway 是一個行程,它沒在跑,訊息就進不來也出不去)、怎麼停掉、以及資料在哪。SOUL.md 放在 Hermes 的家目錄,記憶與技能同樣是檔案而不是雲端帳號裡的資料——要備份或搬到別台機器,複製檔案就是全部的動作。

你要付出的代價

模型費用照付。Hermes 是 MIT 授權,這是真正的開源授權,不是那種「看起來開源但有商用限制」的模式(關於這類授權差異,n8n 與 Make 的比較裡有完整說明)。但框架免費不等於使用免費:它要接一個模型才會動,接雲端 API 就按 token 計費,接自己機器上的模型就是硬體與電費。開源省下的是框架的錢,不是運算的錢。

它會在你沒看著的時候花錢。這一點是常駐型 agent 特有的。排程每天跑、gateway 隨時待命,代表它可能在你睡覺時呼叫模型。第一個月請把用量盯緊,並且從最低頻率的排程開始加。

維運責任在自己身上。版本更新、相依套件衝突、伺服器安全、憑證管理,全部是自己的事。這是自架方案最常被低估的成本,而且它以你的時間計價。

安全面要自己想清楚。一個常駐、有記憶、能執行程式碼、還接著多個通訊軟體的 agent,攻擊面比一個開了才用的命令列工具大得多。容器強化是底線,存取控制要自己設,這兩件事沒做就上線,風險是實質的。

成熟度有差距。這是一個迭代很快的年輕專案,光是執行後端的數量在官網、文件與 repo 之間就對不上。跟已經有桌面應用、IDE 外掛、企業部署方案的商業產品比,穩定性與周邊完整度還有距離。

什麼情況適合、什麼情況不適合

適合

  • 有重複性高的日常工作,值得讓它慢慢累積成技能。
  • 想要有東西在你不在的時候替你盯著、到時間主動回報。
  • 不想被單一模型供應商綁住,或需要在不同模型之間切換比較。
  • 資料有規定不能送到特定廠商,需要自己掌握執行環境。
  • 接受維運成本,也有一台可以一直開著的機器。

不適合

  • 主要需求是寫程式,要的是現在就能用、IDE 整合完整的成熟工具。
  • 已經在付對應的訂閱,邊際成本接近零。
  • 不想花時間在安裝、設定、維運與排錯上。
  • 用量零星——學習迴圈需要足夠的使用量才累積得出價值。

這兩組不互斥。實務上最常見的組合是:寫程式用商業 agent,另外自架一個 Hermes 處理排程、通知與跨平台的雜事。兩邊做的本來就不是同一件事。

常見問題

Hermes Agent 跟 Hermes 模型是同一個東西嗎?

不是,這是最常見的誤會。Hermes 系列是開放權重的語言模型,可以下載下來自己跑;Hermes Agent 是一個不含模型的 agent 框架。兩者出自同一個團隊,可以搭在一起用,也可以讓 Hermes Agent 去接完全不相干的模型。

Hermes Agent 完全免費嗎?

框架是 MIT 授權、免費,但它需要接一個模型才會動,那部分照原本的方式計費:用雲端 API 就按 token 付費,用自己機器上的模型就是硬體攤提加電費。免費指的是框架授權,不是總成本。

它是 OpenClaw 的分支嗎?

不是。兩者是不同團隊、不同程式語言的獨立專案,Hermes 只是提供了搬家功能——設定精靈會偵測既有的 OpenClaw 設定並詢問是否匯入,可以帶走身分檔、記憶、自建技能、指令允許清單與訊息平台設定。不少二手文章把這寫成 fork,是錯的。

執行後端到底是幾種?

官網寫五種、第三方整理的文件寫六種、GitHub README 寫七種。以官方 repo 為準比較安全,但這個落差本身就是有用的資訊:這個專案迭代很快,看到的任何數字都該回頭確認版本。

自架的話資料就一定不會外流嗎?

不一定,取決於兩件事:模型跑在哪裡,以及執行後端選了哪一種。如果 agent 裝在自己機器上但接的是雲端 API,內容還是會送到那家服務商;如果執行後端選了第三方託管的沙箱,程式碼就是在別人的機器上跑。想要資料真的不出門,模型與執行環境兩邊都要選本機的選項,而且應該實際做斷網測試驗證,不要只看設定畫面。

它能取代 Claude Code 寫程式嗎?

寫得好不好主要取決於接的是哪個模型,而不是 Hermes 本身。但商業 agent 有針對寫程式場景做的整合——IDE 外掛、差異檢視、版本控制流程——這些是產品層的投入,不是換個模型就會有的。把它當成「多一個會自己動的助理」比當成「取代寫程式工具」實際。

把這篇放進別人的河裡

ThreadsLINEX

river breath・河的呼吸

讀完不急著走。跟著河面呼吸三輪,把讀到的,沉下去。

吸 —— 讓念頭浮起

「唵」—— 圓滿俱足,我與河本為一體

Wudelay ・ 人生之河

同一條支流

NotebookLM 使用教學:從上傳資料到生成播客

2026-08-318 分鐘