argos1111/sarashina2.2-vision-3b-mmproj-jev-f16

Model

Sarashina2.2 Vision 3B — mmproj (F16) for Jev Local

0

7 commits

1 linked in READMEs

updated Sep 22, 2026

See the code

README

Sarashina2.2 Vision 3B — mmproj (F16) for Jev Local

Sarashina2.2 Vision 3Bの画像入力をllama.cppで使うための、画像エンコーダー+projector(mmproj)です。Jev LocalのAPIで、画像に対する選択式・段階式・真偽の判定に使います。

  • 動作環境: Linux x86_64 / WSL2。CPU、AMD GPU(ROCm)、NVIDIA GPU(CUDA)
  • 必要なもの: このmmproj、Sarashinaの言語GGUF、Jev Localと対応ランタイム(いずれも以下の手順で取得)
  • 未修正のllama.cppでは動きません

1. Jev Localを用意する

git clone https://github.com/Argos1111/jev_local.git
cd jev_local

Python 3.12以上が必要です。追加のPythonパッケージは不要です。

2. モデルファイルを取得する

このリポジトリから次の2ファイルをダウンロードし、models/へ置きます。

ファイル内容
sarashina2.2-vision-3b.mmproj-jev-official-f16.ggufmmproj本体(約893 MB)
sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf.json起動時の整合性確認に必要
mkdir -p models
curl -L -o models/sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf \
  https://huggingface.co/argos1111/sarashina2.2-vision-3b-mmproj-jev-f16/resolve/main/sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf
curl -L -o models/sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf.json \
  https://huggingface.co/argos1111/sarashina2.2-vision-3b-mmproj-jev-f16/resolve/main/sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf.json

言語GGUFはmradermacher/sarashina2.2-vision-3b-GGUFのものを使います。次のコマンドでsarashina2.2-vision-3b.Q4_K_M.gguf(約2.07 GB)をmodels/へ取得します。ログイン不要で、SHA256を検証します。

./setup.sh --model sarashina --model-only

Q8_0(sarashina2.2-vision-3b.Q8_0.gguf、約3.57 GB)を使う場合は--model sarashina-q8を指定します。自分でダウンロードしたファイルをmodels/へ置いても構いません。

3. ランタイムを取得する

対応ランタイムのリリースページから環境に合うアーカイブをダウンロードして展開します。

環境アーカイブ
CPUのみ...-linux-x86_64-cpu.tar.gz
AMD GPU(ROCm。RX 7900シリーズ、Radeon AI PRO R9700などgfx1100 / gfx1201)...-linux-x86_64-hip-gfx1100-gfx1201.tar.gz
NVIDIA GPU(CUDA 13。RTX 40シリーズ)...-linux-x86_64-cuda13-sm89.tar.gz

GPU版はROCm / CUDAのライブラリとドライバーが別途必要です。CUDA版はNVIDIA実機での動作を確認できていないため、問題があればIssueで知らせてください。ほかのGPUや、AVX2非対応のCPUでは、リリースページの手順でソースからビルドできます。

4. 起動する

Jev Localのルートで、展開したディレクトリを--buildに指定します。

# CPU
python3 scripts/run_sarashina.py --backend cpu --build /path/to/llama-b11042-jev-sarashina-pre1-linux-x86_64-cpu

# AMD GPU
python3 scripts/run_sarashina.py --backend hip --build /path/to/llama-b11042-jev-sarashina-pre1-linux-x86_64-hip-gfx1100-gfx1201

# NVIDIA GPU
python3 scripts/run_sarashina.py --backend cuda --build /path/to/llama-b11042-jev-sarashina-pre1-linux-x86_64-cuda13-sm89

Q8_0を使う場合は--model sarashina-q8を追加します。APIはhttp://127.0.0.1:8080で待ち受けます。

5. 画像で質問する

別のターミナルから、画像(PNG / JPEG、4 MiBまで、最大4枚)を添えて質問します。

python3 systemone_client.py --input examples/vision.json --image /path/to/photo.jpg

examples/vision.jsonを編集して質問と選択肢を変えられます。APIの仕様はJev LocalのAPIドキュメントを参照してください。

注意点

  • 選択式の質問は26候補までです。
  • 単色画像や複数枚の画像の扱い、選択肢の順番による結果の変化など、既知の制約があります。詳細はSarashinaバックエンドの説明を参照してください。
  • SB Intuitionsによる公式配布ではありません。

ライセンス

Sarashina2.2 Vision 3BはMIT License(Copyright (c) 2025 SB Intuitions)、画像エンコーダーの元になったSigLIPはApache-2.0です。両方の全文をLICENSE.sarashina2.2-vision-3bとLICENSE.siglipとして同梱しています。変換元・変更内容はNOTICE.md、ファイルのSHA256はSHA256SUMSを参照してください。

gguf
mmproj
multimodal
sarashina2vl
vision-language

argos1111/sarashina2.2-vision-3b-mmproj-jev-f16

Model

Sarashina2.2 Vision 3B — mmproj (F16) for Jev Local

0

7 commits

1 linked in READMEs

updated Sep 22, 2026

See the code

README

Sarashina2.2 Vision 3B — mmproj (F16) for Jev Local

Sarashina2.2 Vision 3Bの画像入力をllama.cppで使うための、画像エンコーダー+projector(mmproj)です。Jev LocalのAPIで、画像に対する選択式・段階式・真偽の判定に使います。

  • 動作環境: Linux x86_64 / WSL2。CPU、AMD GPU(ROCm)、NVIDIA GPU(CUDA)
  • 必要なもの: このmmproj、Sarashinaの言語GGUF、Jev Localと対応ランタイム(いずれも以下の手順で取得)
  • 未修正のllama.cppでは動きません

1. Jev Localを用意する

git clone https://github.com/Argos1111/jev_local.git
cd jev_local

Python 3.12以上が必要です。追加のPythonパッケージは不要です。

2. モデルファイルを取得する

このリポジトリから次の2ファイルをダウンロードし、models/へ置きます。

ファイル内容
sarashina2.2-vision-3b.mmproj-jev-official-f16.ggufmmproj本体(約893 MB)
sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf.json起動時の整合性確認に必要
mkdir -p models
curl -L -o models/sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf \
  https://huggingface.co/argos1111/sarashina2.2-vision-3b-mmproj-jev-f16/resolve/main/sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf
curl -L -o models/sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf.json \
  https://huggingface.co/argos1111/sarashina2.2-vision-3b-mmproj-jev-f16/resolve/main/sarashina2.2-vision-3b.mmproj-jev-official-f16.gguf.json

言語GGUFはmradermacher/sarashina2.2-vision-3b-GGUFのものを使います。次のコマンドでsarashina2.2-vision-3b.Q4_K_M.gguf(約2.07 GB)をmodels/へ取得します。ログイン不要で、SHA256を検証します。

./setup.sh --model sarashina --model-only

Q8_0(sarashina2.2-vision-3b.Q8_0.gguf、約3.57 GB)を使う場合は--model sarashina-q8を指定します。自分でダウンロードしたファイルをmodels/へ置いても構いません。

3. ランタイムを取得する

対応ランタイムのリリースページから環境に合うアーカイブをダウンロードして展開します。

環境アーカイブ
CPUのみ...-linux-x86_64-cpu.tar.gz
AMD GPU(ROCm。RX 7900シリーズ、Radeon AI PRO R9700などgfx1100 / gfx1201)...-linux-x86_64-hip-gfx1100-gfx1201.tar.gz
NVIDIA GPU(CUDA 13。RTX 40シリーズ)...-linux-x86_64-cuda13-sm89.tar.gz

GPU版はROCm / CUDAのライブラリとドライバーが別途必要です。CUDA版はNVIDIA実機での動作を確認できていないため、問題があればIssueで知らせてください。ほかのGPUや、AVX2非対応のCPUでは、リリースページの手順でソースからビルドできます。

4. 起動する

Jev Localのルートで、展開したディレクトリを--buildに指定します。

# CPU
python3 scripts/run_sarashina.py --backend cpu --build /path/to/llama-b11042-jev-sarashina-pre1-linux-x86_64-cpu

# AMD GPU
python3 scripts/run_sarashina.py --backend hip --build /path/to/llama-b11042-jev-sarashina-pre1-linux-x86_64-hip-gfx1100-gfx1201

# NVIDIA GPU
python3 scripts/run_sarashina.py --backend cuda --build /path/to/llama-b11042-jev-sarashina-pre1-linux-x86_64-cuda13-sm89

Q8_0を使う場合は--model sarashina-q8を追加します。APIはhttp://127.0.0.1:8080で待ち受けます。

5. 画像で質問する

別のターミナルから、画像(PNG / JPEG、4 MiBまで、最大4枚)を添えて質問します。

python3 systemone_client.py --input examples/vision.json --image /path/to/photo.jpg

examples/vision.jsonを編集して質問と選択肢を変えられます。APIの仕様はJev LocalのAPIドキュメントを参照してください。

注意点

  • 選択式の質問は26候補までです。
  • 単色画像や複数枚の画像の扱い、選択肢の順番による結果の変化など、既知の制約があります。詳細はSarashinaバックエンドの説明を参照してください。
  • SB Intuitionsによる公式配布ではありません。

ライセンス

Sarashina2.2 Vision 3BはMIT License(Copyright (c) 2025 SB Intuitions)、画像エンコーダーの元になったSigLIPはApache-2.0です。両方の全文をLICENSE.sarashina2.2-vision-3bとLICENSE.siglipとして同梱しています。変換元・変更内容はNOTICE.md、ファイルのSHA256はSHA256SUMSを参照してください。

gguf
mmproj
multimodal
sarashina2vl
vision-language