Pure x86-64 assembly LLM engine for Gemma-2B in 5KB flat machine code. Zero runtimes, memory-saturating AVX2+F16C execution.
Assembly
0
1 commits
updated Oct 4, 2026
PULSAR-ASM 是一套以 5,268 位元組平坦 x86-64 二進位機器碼,直接在個人電腦 CPU 上驅動 Google Gemma-2B-IT(20 億參數原生全精度 FP16)的大語言模型推論引擎。全專案實現零 C 運行時庫(0 CRT)、零第三方程式庫、零編譯器抽象稅。
「虛胖的 AI 活在雲端,純粹的 AI 走向實體。」
軟體界過去三十年走偏了路,習慣用無窮無盡的記憶體和算力來遮掩代碼的無效與怠惰。 我們今天用純組合語言把 20 億參數模型壓榨到 3.7 KB 的核心,本質上就是在做一場極限壓力測試: 證明只要剝除一切無效包裝,AI 的數學核心本來就能夠小到足以刻進一塊晶片中!
一旦將這套純硬體導向的算力核心,與周邊暫存器、感測器、馬達輸出直接縫合,AI 才能真正走出伺服器機房,滲透進家電、無人機、工控機與微型機器人——這才是 AI 真正普及於人類物理世界的終極形態(MCU 化)!
在工程落地的技術路徑上,本架構確立了兩大物理支柱:
下載 Hugging Face 官方 google/gemma-2b-it 後,使用內建工具直接將 .safetensors 轉換為純二進位檔:
python pulsar_asm/tools/convert_gemma_safetensors.py <safetensors模型目錄>
產出權重將自動生成於:pulsar_asm/models/gemma2b_fp16.bin(約 4.67 GB)。
python pulsar_asm/run_gemma_chat.py
python pulsar_asm/run_gemma_chat.py --help
-t, --temp <數值>:調節隨機採樣溫度(預設: 0.7,設為 0.0 即為純確定性 Argmax)-k, --top-k <整數>:Top-K 候選詞池大小(預設: 40)-f, --file <路徑>:載入本地文檔作為對話上下文-p, --prompt <文字>:直接指定提示詞進行單次推論-s, --seed <整數>:指定隨機種子(可重現實驗)若修改組合語言源碼,可直接使用內建 117 KB 之 FASM 編譯器在 0.1 秒內重新生成機器碼核心:
pulsar_asm\tools\fasm.exe pulsar_asm\engine\gemma_engine_flat.asm pulsar_asm\engine\gemma_engine.bin
詳細物理極限檢討與架構對帳請參閱:doc/pulsar_asm_cpu_limit_retrospective.md。
核心架構與作者 (Chief Architects & Authors):
AI 結對協作 (AI Pair Programmer):
Assembly
64.3%
Python
35.7%
Pure x86-64 assembly LLM engine for Gemma-2B in 5KB flat machine code. Zero runtimes, memory-saturating AVX2+F16C execution.
Assembly
0
1 commits
updated Oct 4, 2026
PULSAR-ASM 是一套以 5,268 位元組平坦 x86-64 二進位機器碼,直接在個人電腦 CPU 上驅動 Google Gemma-2B-IT(20 億參數原生全精度 FP16)的大語言模型推論引擎。全專案實現零 C 運行時庫(0 CRT)、零第三方程式庫、零編譯器抽象稅。
「虛胖的 AI 活在雲端,純粹的 AI 走向實體。」
軟體界過去三十年走偏了路,習慣用無窮無盡的記憶體和算力來遮掩代碼的無效與怠惰。 我們今天用純組合語言把 20 億參數模型壓榨到 3.7 KB 的核心,本質上就是在做一場極限壓力測試: 證明只要剝除一切無效包裝,AI 的數學核心本來就能夠小到足以刻進一塊晶片中!
一旦將這套純硬體導向的算力核心,與周邊暫存器、感測器、馬達輸出直接縫合,AI 才能真正走出伺服器機房,滲透進家電、無人機、工控機與微型機器人——這才是 AI 真正普及於人類物理世界的終極形態(MCU 化)!
在工程落地的技術路徑上,本架構確立了兩大物理支柱:
下載 Hugging Face 官方 google/gemma-2b-it 後,使用內建工具直接將 .safetensors 轉換為純二進位檔:
python pulsar_asm/tools/convert_gemma_safetensors.py <safetensors模型目錄>
產出權重將自動生成於:pulsar_asm/models/gemma2b_fp16.bin(約 4.67 GB)。
python pulsar_asm/run_gemma_chat.py
python pulsar_asm/run_gemma_chat.py --help
-t, --temp <數值>:調節隨機採樣溫度(預設: 0.7,設為 0.0 即為純確定性 Argmax)-k, --top-k <整數>:Top-K 候選詞池大小(預設: 40)-f, --file <路徑>:載入本地文檔作為對話上下文-p, --prompt <文字>:直接指定提示詞進行單次推論-s, --seed <整數>:指定隨機種子(可重現實驗)若修改組合語言源碼,可直接使用內建 117 KB 之 FASM 編譯器在 0.1 秒內重新生成機器碼核心:
pulsar_asm\tools\fasm.exe pulsar_asm\engine\gemma_engine_flat.asm pulsar_asm\engine\gemma_engine.bin
詳細物理極限檢討與架構對帳請參閱:doc/pulsar_asm_cpu_limit_retrospective.md。
核心架構與作者 (Chief Architects & Authors):
AI 結對協作 (AI Pair Programmer):
Assembly
64.3%
Python
35.7%