vito95311/minicpm-o-guardian-pai

Model

0

stars

8

commits

1

linked in READMEs

Jun 12, 2026

updated

agent
full-duplex
omni
pai
proactive-ai
speech

README

minicpm-o-guardian.pai — Full-Duplex Omni Proactive AI Agent

openbmb/MiniCPM-o-4_5(9B omni:影像+音訊輸入、文字+語音輸出、全雙工)為決策腦的 主動式 agent,打包成單一 .pai 檔。

本檔 不內嵌權重(約 2 KB,只含 agent 設定,引用基底模型)。transformers 路徑執行時 會從 Hugging Face 自動載入 openbmb/MiniCPM-o-4_5。若要離線單檔,可改打包內嵌 GGUF (openbmb/MiniCPM-o-4_5-gguf),見 pack_minicpm_o.pyWEIGHTS

(刻意不設 base_model_relation:這不是 adapter/finetune/quantized/merge 任一種, 而是「引用基底模型的 agent 設定」,避免被歸入 MiniCPM-o 的 adapters 列表造成誤導。)

為什麼用 MiniCPM-o

MiniCPM-o 4.5 能同時看、聽、說,且原生支援主動互動(依現場持續理解主動發起提醒/評論) ——天然契合 PAI 的「事件驅動 + 持續感知 + 受治理主動行為」範式。

內容(.pai 段)

內容
manifest.jsonomni agent 中繼資料
policy.json主動性治理(安靜時段、自主等級上限、干擾度公式)
triggers.json / rules.json / actions.json宣告式感知/規則/動作
brain.jsonengine: minicpm-oomni_engine: transformers

使用

git clone https://github.com/vito1317/pai-framework && cd pai-framework
pip install "transformers==4.51.0" accelerate "torch>=2.3.0" torchaudio "minicpmo-utils[all]>=1.0.5"

# 下載本 .pai 後
python3 -m pai run minicpm-o-guardian.pai

DuplexOmniLoop 把模型的全雙工串流包成「持續感知 trigger」:模型自己決定何時主動發話, 治理層仍決定是否放行、用什麼等級打擾。微調走 LlamaFactoryBackend(LoRA), self-finetuning 三層(記憶 / LoRA 熱插拔 / EvalGate)完全沿用。

協定名 PAIDProactive Agent Infrastructure with Dynamic-finetuning)。需要 paigent >= 0.1.3

pip install "paigent>=0.1.3"

決策腦建議共用既有的 llama-server,不要用 transformers 路徑另載一份模型(省 RAM):

from pai import load_runtime
from pai.omni_brain import MiniCPMoBrain

agent = load_runtime("minicpm-o-guardian.pai", memory_path="guardian_memory.db")
agent.brain = MiniCPMoBrain(
    list(agent.actions), engine="llama-server",
    base_url="http://127.0.0.1:10003",   # 不帶 /v1,brain 自補路徑
    fallback=agent.brain.fallback,
)

brain.jsonlearning: true 啟用 ReflectiveMemory;人類核准/駁回經回饋端點寫入, 下次相似情境檢索教訓注入決策。回饋鍵需與 _event_summary(event) 一致(用 event_id→summary 對照表還原),完整接平台範例見框架 README。

硬體

  • transformers 路徑:建議 CUDA GPU(≥16GB)或 Apple Silicon。device 自動偵測(cuda→mps→cpu),無需手動指定
  • 全雙工即時串流建議搭配官方 llama.cpp-omni + WebRTC demo

相關連結

License

框架:MIT。模型:apache-2.0(OpenBMB MiniCPM-o 4.5)。

Author: vito1317 service@vito1317.com

Contributors

vito95311

8 commits

vito95311/minicpm-o-guardian-pai

Model

0

stars

8

commits

1

linked in READMEs

Jun 12, 2026

updated

agent
full-duplex
omni
pai
proactive-ai
speech

README

minicpm-o-guardian.pai — Full-Duplex Omni Proactive AI Agent

openbmb/MiniCPM-o-4_5(9B omni:影像+音訊輸入、文字+語音輸出、全雙工)為決策腦的 主動式 agent,打包成單一 .pai 檔。

本檔 不內嵌權重(約 2 KB,只含 agent 設定,引用基底模型)。transformers 路徑執行時 會從 Hugging Face 自動載入 openbmb/MiniCPM-o-4_5。若要離線單檔,可改打包內嵌 GGUF (openbmb/MiniCPM-o-4_5-gguf),見 pack_minicpm_o.pyWEIGHTS

(刻意不設 base_model_relation:這不是 adapter/finetune/quantized/merge 任一種, 而是「引用基底模型的 agent 設定」,避免被歸入 MiniCPM-o 的 adapters 列表造成誤導。)

為什麼用 MiniCPM-o

MiniCPM-o 4.5 能同時看、聽、說,且原生支援主動互動(依現場持續理解主動發起提醒/評論) ——天然契合 PAI 的「事件驅動 + 持續感知 + 受治理主動行為」範式。

內容(.pai 段)

內容
manifest.jsonomni agent 中繼資料
policy.json主動性治理(安靜時段、自主等級上限、干擾度公式)
triggers.json / rules.json / actions.json宣告式感知/規則/動作
brain.jsonengine: minicpm-oomni_engine: transformers

使用

git clone https://github.com/vito1317/pai-framework && cd pai-framework
pip install "transformers==4.51.0" accelerate "torch>=2.3.0" torchaudio "minicpmo-utils[all]>=1.0.5"

# 下載本 .pai 後
python3 -m pai run minicpm-o-guardian.pai

DuplexOmniLoop 把模型的全雙工串流包成「持續感知 trigger」:模型自己決定何時主動發話, 治理層仍決定是否放行、用什麼等級打擾。微調走 LlamaFactoryBackend(LoRA), self-finetuning 三層(記憶 / LoRA 熱插拔 / EvalGate)完全沿用。

協定名 PAIDProactive Agent Infrastructure with Dynamic-finetuning)。需要 paigent >= 0.1.3

pip install "paigent>=0.1.3"

決策腦建議共用既有的 llama-server,不要用 transformers 路徑另載一份模型(省 RAM):

from pai import load_runtime
from pai.omni_brain import MiniCPMoBrain

agent = load_runtime("minicpm-o-guardian.pai", memory_path="guardian_memory.db")
agent.brain = MiniCPMoBrain(
    list(agent.actions), engine="llama-server",
    base_url="http://127.0.0.1:10003",   # 不帶 /v1,brain 自補路徑
    fallback=agent.brain.fallback,
)

brain.jsonlearning: true 啟用 ReflectiveMemory;人類核准/駁回經回饋端點寫入, 下次相似情境檢索教訓注入決策。回饋鍵需與 _event_summary(event) 一致(用 event_id→summary 對照表還原),完整接平台範例見框架 README。

硬體

  • transformers 路徑:建議 CUDA GPU(≥16GB)或 Apple Silicon。device 自動偵測(cuda→mps→cpu),無需手動指定
  • 全雙工即時串流建議搭配官方 llama.cpp-omni + WebRTC demo

相關連結

License

框架:MIT。模型:apache-2.0(OpenBMB MiniCPM-o 4.5)。

Author: vito1317 service@vito1317.com

Contributors

vito95311

8 commits