以 openbmb/MiniCPM-o-4_5(9B omni:影像+音訊輸入、文字+語音輸出、全雙工)為決策腦的
主動式 agent,打包成單一 .pai 檔。
本檔 不內嵌權重(約 2 KB,只含 agent 設定,引用基底模型)。
transformers路徑執行時 會從 Hugging Face 自動載入openbmb/MiniCPM-o-4_5。若要離線單檔,可改打包內嵌 GGUF (openbmb/MiniCPM-o-4_5-gguf),見pack_minicpm_o.py的WEIGHTS。(刻意不設
base_model_relation:這不是 adapter/finetune/quantized/merge 任一種, 而是「引用基底模型的 agent 設定」,避免被歸入 MiniCPM-o 的 adapters 列表造成誤導。)
MiniCPM-o 4.5 能同時看、聽、說,且原生支援主動互動(依現場持續理解主動發起提醒/評論) ——天然契合 PAI 的「事件驅動 + 持續感知 + 受治理主動行為」範式。
.pai 段)| 段 | 內容 |
|---|---|
manifest.json | omni agent 中繼資料 |
policy.json | 主動性治理(安靜時段、自主等級上限、干擾度公式) |
triggers.json / rules.json / actions.json | 宣告式感知/規則/動作 |
brain.json | engine: minicpm-o、omni_engine: transformers |
git clone https://github.com/vito1317/pai-framework && cd pai-framework
pip install "transformers==4.51.0" accelerate "torch>=2.3.0" torchaudio "minicpmo-utils[all]>=1.0.5"
# 下載本 .pai 後
python3 -m pai run minicpm-o-guardian.pai
DuplexOmniLoop 把模型的全雙工串流包成「持續感知 trigger」:模型自己決定何時主動發話,
治理層仍決定是否放行、用什麼等級打擾。微調走 LlamaFactoryBackend(LoRA),
self-finetuning 三層(記憶 / LoRA 熱插拔 / EvalGate)完全沿用。
協定名 PAID(Proactive Agent Infrastructure with Dynamic-finetuning)。需要
paigent >= 0.1.3:
pip install "paigent>=0.1.3"
決策腦建議共用既有的 llama-server,不要用 transformers 路徑另載一份模型(省 RAM):
from pai import load_runtime
from pai.omni_brain import MiniCPMoBrain
agent = load_runtime("minicpm-o-guardian.pai", memory_path="guardian_memory.db")
agent.brain = MiniCPMoBrain(
list(agent.actions), engine="llama-server",
base_url="http://127.0.0.1:10003", # 不帶 /v1,brain 自補路徑
fallback=agent.brain.fallback,
)
brain.json 的 learning: true 啟用 ReflectiveMemory;人類核准/駁回經回饋端點寫入,
下次相似情境檢索教訓注入決策。回饋鍵需與 _event_summary(event) 一致(用 event_id→summary
對照表還原),完整接平台範例見框架 README。
llama.cpp-omni + WebRTC demopip install paigent框架:MIT。模型:apache-2.0(OpenBMB MiniCPM-o 4.5)。
Author: vito1317 service@vito1317.com
8 commits
以 openbmb/MiniCPM-o-4_5(9B omni:影像+音訊輸入、文字+語音輸出、全雙工)為決策腦的
主動式 agent,打包成單一 .pai 檔。
本檔 不內嵌權重(約 2 KB,只含 agent 設定,引用基底模型)。
transformers路徑執行時 會從 Hugging Face 自動載入openbmb/MiniCPM-o-4_5。若要離線單檔,可改打包內嵌 GGUF (openbmb/MiniCPM-o-4_5-gguf),見pack_minicpm_o.py的WEIGHTS。(刻意不設
base_model_relation:這不是 adapter/finetune/quantized/merge 任一種, 而是「引用基底模型的 agent 設定」,避免被歸入 MiniCPM-o 的 adapters 列表造成誤導。)
MiniCPM-o 4.5 能同時看、聽、說,且原生支援主動互動(依現場持續理解主動發起提醒/評論) ——天然契合 PAI 的「事件驅動 + 持續感知 + 受治理主動行為」範式。
.pai 段)| 段 | 內容 |
|---|---|
manifest.json | omni agent 中繼資料 |
policy.json | 主動性治理(安靜時段、自主等級上限、干擾度公式) |
triggers.json / rules.json / actions.json | 宣告式感知/規則/動作 |
brain.json | engine: minicpm-o、omni_engine: transformers |
git clone https://github.com/vito1317/pai-framework && cd pai-framework
pip install "transformers==4.51.0" accelerate "torch>=2.3.0" torchaudio "minicpmo-utils[all]>=1.0.5"
# 下載本 .pai 後
python3 -m pai run minicpm-o-guardian.pai
DuplexOmniLoop 把模型的全雙工串流包成「持續感知 trigger」:模型自己決定何時主動發話,
治理層仍決定是否放行、用什麼等級打擾。微調走 LlamaFactoryBackend(LoRA),
self-finetuning 三層(記憶 / LoRA 熱插拔 / EvalGate)完全沿用。
協定名 PAID(Proactive Agent Infrastructure with Dynamic-finetuning)。需要
paigent >= 0.1.3:
pip install "paigent>=0.1.3"
決策腦建議共用既有的 llama-server,不要用 transformers 路徑另載一份模型(省 RAM):
from pai import load_runtime
from pai.omni_brain import MiniCPMoBrain
agent = load_runtime("minicpm-o-guardian.pai", memory_path="guardian_memory.db")
agent.brain = MiniCPMoBrain(
list(agent.actions), engine="llama-server",
base_url="http://127.0.0.1:10003", # 不帶 /v1,brain 自補路徑
fallback=agent.brain.fallback,
)
brain.json 的 learning: true 啟用 ReflectiveMemory;人類核准/駁回經回饋端點寫入,
下次相似情境檢索教訓注入決策。回饋鍵需與 _event_summary(event) 一致(用 event_id→summary
對照表還原),完整接平台範例見框架 README。
llama.cpp-omni + WebRTC demopip install paigent框架:MIT。模型:apache-2.0(OpenBMB MiniCPM-o 4.5)。
Author: vito1317 service@vito1317.com
8 commits