An Open-Source Benchmark & Playground for Large Audio-Language Models
LALMsArena は、次世代の「Large Audio-Language Models」をサイド・バイ・サイドで比較・評価するためのオープンソース・プレイグラウンドです。 ASR(文字起こし)を介さず、音声を直接「理解」するモデル(Large Audio LLMs)が、会話、環境音、感情、音楽をどのように推論するかを、開発者が直感的に検証・ベンチマークできる環境を提供します。
| モデル | パラメータ | 必要VRAM | HuggingFace |
|---|---|---|---|
| MOSS-Audio-4B | 4B | ~11 GB | OpenMOSS-Team/MOSS-Audio-4B-Instruct |
| Qwen2-Audio | 7B | ~16 GB | Qwen/Qwen2-Audio-7B-Instruct |
| Gemma-4-E4B | 4B | ~16 GB | google/gemma-4-E4B-it |
| Gemma-4-12B | 12B | ~32 GB | google/gemma-4-12B-it |
| Audio Flamingo Next | 7B | ~16 GB | nvidia/audio-flamingo-next-hf |
| Audio Flamingo Next Captioner | 7B | ~16 GB | nvidia/audio-flamingo-next-captioner-hf |
| Audio Flamingo Next Think | 7B | ~16 GB | nvidia/audio-flamingo-next-think-hf |
| MOSS-Audio-8B | 8B | ~17 GB | OpenMOSS-Team/MOSS-Audio-8B-Instruct |
| MOSS-Audio-8B-Thinking | 8B | ~17 GB | OpenMOSS-Team/MOSS-Audio-8B-Thinking |
| MiMo-Audio-7B | 7B+1.2B | ~18 GB | XiaomiMiMo/MiMo-Audio-7B-Instruct |
| MiMo-Audio-7B-Thinking | 7B+1.2B | ~18 GB | XiaomiMiMo/MiMo-Audio-7B-Instruct |
| Audio-Omni | 7B+DiT | ~24 GB | HKUSTAudio/Audio-Omni |
| SALMONN-13B ⚠️ | 13B | ~26 GB | tsinghua-ee/SALMONN |
| Nemotron-Labs-Audex-30B-A3B | 30B-A3B (MoE) | ~92 GB | nvidia/Nemotron-Labs-Audex-30B-A3B |
| Qwen3-Omni-Captioner | 30B-A3B (MoE) | ~61 GB | Qwen/Qwen3-Omni-30B-A3B-Captioner |
| Qwen3-Omni-Thinking | 30B-A3B (MoE) | ~61 GB | Qwen/Qwen3-Omni-30B-A3B-Thinking |
| Nemotron-Nano-Omni-Reasoning | 30B-A3B (MoE) | ~61 GB | nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 |
| Qwen3-Omni | 30B-A3B (MoE) | ~68 GB | Qwen/Qwen3-Omni-30B-A3B-Instruct |
| Step-Audio-R1.1 | 33B | ~80 GB | stepfun-ai/Step-Audio-R1.1 |
Think / Thinking モデルは推論過程(
<think>...</think>)を UI 上の「思考過程」エキスパンダーで確認できます。
⚠️ SALMONN-13B は BEATs の事前学習済みチェックポイント(
BEATs_iter3_plus_AS2M.pt)を手動でダウンロードしてSALMONN_BEATS_PATH環境変数に設定する必要があります。詳細は 起動方法 を参照してください。
⚠️ Nemotron-Labs-Audex-30B-A3B は NVIDIA Oneway Noncommercial License の対象です。利用前に Hugging Face のモデルカードでライセンス条件を確認してください。
Python 3.11 と uv が必要です。
HuggingFace キャッシュの場所
デフォルトでは/workspace/.cache/huggingfaceにキャッシュが保存されます。
大容量の外部ストレージを使いたい場合は.devcontainer/devcontainer.jsonのコメントアウトされたマウント行を参照してください。
# リポジトリのクローン
git clone https://github.com/kasahart/LALMsArena.git
cd LALMsArena
# 依存関係のインストール
uv sync --frozen
LALMsArena は 各モデルを独立した Docker コンテナで動かし、Streamlit UI からコンテナの推論 API を呼び出す構成です。
各コンテナの Python 依存関係は Dockerfile の build 時にモデルごとの専用環境へインストールされます。初回起動時や依存関係を更新した後は、必要に応じて docker compose build を実行してください。
GPU 環境(推奨):
# 必要なら先に build
docker compose -f docker-compose.yml -f docker-compose.gpu.yml build qwen2-audio
# 全モデルを起動(大型モデルを除く)
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d \
qwen2-audio audio-flamingo audio-flamingo-captioner audio-flamingo-think \
gemma4-e4b gemma4-12b moss-4b moss-8b moss-8b-thinking mimo-audio mimo-audio-thinking
# Qwen3-Omni(~61-68 GB VRAM 必要、3バリアント)
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d \
qwen3-omni qwen3-omni-captioner qwen3-omni-thinking
# 特定のモデルだけ起動
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d qwen2-audio
Audio-Omni(~24 GB VRAM 必要):
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d audio-omni
Nemotron-Nano-Omni-Reasoning(~61 GB VRAM 必要):
# vLLM サイドカー + FastAPI プロキシの2コンテナ構成
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d nemotron-vllm nemotron-omni-reasoning
Nemotron-Labs-Audex-30B-A3B(~92 GB VRAM 必要):
# vLLM サイドカー + FastAPI プロキシの2コンテナ構成
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d audex-vllm audex-30b-a3b
Step-Audio-R1.1(~80 GB VRAM 必要):
# vLLM サイドカー + FastAPI プロキシの2コンテナ構成
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d step-audio-vllm step-audio-r1
SALMONN-13B(要 SALMONN_BEATS_PATH 環境変数):
SALMONN_BEATS_PATH=/path/to/BEATs_iter3_plus_AS2M.pt \
docker compose -f docker-compose.yml -f docker-compose.gpu.yml --profile salmonn up -d salmonn-13b
| サービス名 | モデル | ポート | 必要VRAM |
|---|---|---|---|
moss-4b | MOSS-Audio-4B | 8603 | ~11 GB |
qwen2-audio | Qwen2-Audio-7B | 8600 | ~16 GB |
gemma4-e4b | Gemma-4-E4B | 8602 | ~16 GB |
gemma4-12b | Gemma-4-12B | 8617 | ~32 GB |
audio-flamingo | Audio Flamingo Next | 8601 | ~16 GB |
audio-flamingo-captioner | Audio Flamingo Next Captioner | 8607 | ~16 GB |
audio-flamingo-think | Audio Flamingo Next Think | 8608 | ~16 GB |
moss-8b | MOSS-Audio-8B | 8604 | ~17 GB |
moss-8b-thinking | MOSS-Audio-8B-Thinking | 8606 | ~17 GB |
mimo-audio | MiMo-Audio-7B | 8613 | ~18 GB |
mimo-audio-thinking | MiMo-Audio-7B-Thinking | 8614 | ~18 GB |
audio-omni | Audio-Omni | 8616 | ~24 GB |
salmonn-13b | SALMONN-13B | 8605 | ~26 GB |
audex-vllm + audex-30b-a3b | Nemotron-Labs-Audex-30B-A3B | 8618 | ~92 GB |
qwen3-omni-captioner | Qwen3-Omni-30B-A3B-Captioner | 8611 | ~61 GB |
qwen3-omni-thinking | Qwen3-Omni-30B-A3B-Thinking | 8612 | ~61 GB |
qwen3-omni | Qwen3-Omni-30B-A3B (Instruct) | 8610 | ~68 GB |
step-audio-vllm + step-audio-r1 | Step-Audio-R1.1 | 8609 | ~80 GB |
コンテナの起動状態はヘルスチェックで確認できます。
docker compose ps
# または個別に確認
curl http://localhost:8600/health
uv run streamlit run app.py
起動後、ブラウザで http://localhost:8501 にアクセスしてください。
サイドバーに各コンテナの稼働状態(🟢/🔴)と必要 VRAM が表示されます。
コンテナのホストを変更する場合 は環境変数
ARENA_API_BASEで上書きできます。
例:ARENA_API_BASE=http://192.168.1.10 uv run streamlit run app.py
各モデルの推論結果とあわせて以下のメトリクスを UI 上で確認できます。
MIT License
76 commits
Python
87.3%
Dockerfile
8.7%
Shell
4.1%
An Open-Source Benchmark & Playground for Large Audio-Language Models
LALMsArena は、次世代の「Large Audio-Language Models」をサイド・バイ・サイドで比較・評価するためのオープンソース・プレイグラウンドです。 ASR(文字起こし)を介さず、音声を直接「理解」するモデル(Large Audio LLMs)が、会話、環境音、感情、音楽をどのように推論するかを、開発者が直感的に検証・ベンチマークできる環境を提供します。
| モデル | パラメータ | 必要VRAM | HuggingFace |
|---|---|---|---|
| MOSS-Audio-4B | 4B | ~11 GB | OpenMOSS-Team/MOSS-Audio-4B-Instruct |
| Qwen2-Audio | 7B | ~16 GB | Qwen/Qwen2-Audio-7B-Instruct |
| Gemma-4-E4B | 4B | ~16 GB | google/gemma-4-E4B-it |
| Gemma-4-12B | 12B | ~32 GB | google/gemma-4-12B-it |
| Audio Flamingo Next | 7B | ~16 GB | nvidia/audio-flamingo-next-hf |
| Audio Flamingo Next Captioner | 7B | ~16 GB | nvidia/audio-flamingo-next-captioner-hf |
| Audio Flamingo Next Think | 7B | ~16 GB | nvidia/audio-flamingo-next-think-hf |
| MOSS-Audio-8B | 8B | ~17 GB | OpenMOSS-Team/MOSS-Audio-8B-Instruct |
| MOSS-Audio-8B-Thinking | 8B | ~17 GB | OpenMOSS-Team/MOSS-Audio-8B-Thinking |
| MiMo-Audio-7B | 7B+1.2B | ~18 GB | XiaomiMiMo/MiMo-Audio-7B-Instruct |
| MiMo-Audio-7B-Thinking | 7B+1.2B | ~18 GB | XiaomiMiMo/MiMo-Audio-7B-Instruct |
| Audio-Omni | 7B+DiT | ~24 GB | HKUSTAudio/Audio-Omni |
| SALMONN-13B ⚠️ | 13B | ~26 GB | tsinghua-ee/SALMONN |
| Nemotron-Labs-Audex-30B-A3B | 30B-A3B (MoE) | ~92 GB | nvidia/Nemotron-Labs-Audex-30B-A3B |
| Qwen3-Omni-Captioner | 30B-A3B (MoE) | ~61 GB | Qwen/Qwen3-Omni-30B-A3B-Captioner |
| Qwen3-Omni-Thinking | 30B-A3B (MoE) | ~61 GB | Qwen/Qwen3-Omni-30B-A3B-Thinking |
| Nemotron-Nano-Omni-Reasoning | 30B-A3B (MoE) | ~61 GB | nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 |
| Qwen3-Omni | 30B-A3B (MoE) | ~68 GB | Qwen/Qwen3-Omni-30B-A3B-Instruct |
| Step-Audio-R1.1 | 33B | ~80 GB | stepfun-ai/Step-Audio-R1.1 |
Think / Thinking モデルは推論過程(
<think>...</think>)を UI 上の「思考過程」エキスパンダーで確認できます。
⚠️ SALMONN-13B は BEATs の事前学習済みチェックポイント(
BEATs_iter3_plus_AS2M.pt)を手動でダウンロードしてSALMONN_BEATS_PATH環境変数に設定する必要があります。詳細は 起動方法 を参照してください。
⚠️ Nemotron-Labs-Audex-30B-A3B は NVIDIA Oneway Noncommercial License の対象です。利用前に Hugging Face のモデルカードでライセンス条件を確認してください。
Python 3.11 と uv が必要です。
HuggingFace キャッシュの場所
デフォルトでは/workspace/.cache/huggingfaceにキャッシュが保存されます。
大容量の外部ストレージを使いたい場合は.devcontainer/devcontainer.jsonのコメントアウトされたマウント行を参照してください。
# リポジトリのクローン
git clone https://github.com/kasahart/LALMsArena.git
cd LALMsArena
# 依存関係のインストール
uv sync --frozen
LALMsArena は 各モデルを独立した Docker コンテナで動かし、Streamlit UI からコンテナの推論 API を呼び出す構成です。
各コンテナの Python 依存関係は Dockerfile の build 時にモデルごとの専用環境へインストールされます。初回起動時や依存関係を更新した後は、必要に応じて docker compose build を実行してください。
GPU 環境(推奨):
# 必要なら先に build
docker compose -f docker-compose.yml -f docker-compose.gpu.yml build qwen2-audio
# 全モデルを起動(大型モデルを除く)
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d \
qwen2-audio audio-flamingo audio-flamingo-captioner audio-flamingo-think \
gemma4-e4b gemma4-12b moss-4b moss-8b moss-8b-thinking mimo-audio mimo-audio-thinking
# Qwen3-Omni(~61-68 GB VRAM 必要、3バリアント)
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d \
qwen3-omni qwen3-omni-captioner qwen3-omni-thinking
# 特定のモデルだけ起動
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d qwen2-audio
Audio-Omni(~24 GB VRAM 必要):
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d audio-omni
Nemotron-Nano-Omni-Reasoning(~61 GB VRAM 必要):
# vLLM サイドカー + FastAPI プロキシの2コンテナ構成
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d nemotron-vllm nemotron-omni-reasoning
Nemotron-Labs-Audex-30B-A3B(~92 GB VRAM 必要):
# vLLM サイドカー + FastAPI プロキシの2コンテナ構成
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d audex-vllm audex-30b-a3b
Step-Audio-R1.1(~80 GB VRAM 必要):
# vLLM サイドカー + FastAPI プロキシの2コンテナ構成
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d step-audio-vllm step-audio-r1
SALMONN-13B(要 SALMONN_BEATS_PATH 環境変数):
SALMONN_BEATS_PATH=/path/to/BEATs_iter3_plus_AS2M.pt \
docker compose -f docker-compose.yml -f docker-compose.gpu.yml --profile salmonn up -d salmonn-13b
| サービス名 | モデル | ポート | 必要VRAM |
|---|---|---|---|
moss-4b | MOSS-Audio-4B | 8603 | ~11 GB |
qwen2-audio | Qwen2-Audio-7B | 8600 | ~16 GB |
gemma4-e4b | Gemma-4-E4B | 8602 | ~16 GB |
gemma4-12b | Gemma-4-12B | 8617 | ~32 GB |
audio-flamingo | Audio Flamingo Next | 8601 | ~16 GB |
audio-flamingo-captioner | Audio Flamingo Next Captioner | 8607 | ~16 GB |
audio-flamingo-think | Audio Flamingo Next Think | 8608 | ~16 GB |
moss-8b | MOSS-Audio-8B | 8604 | ~17 GB |
moss-8b-thinking | MOSS-Audio-8B-Thinking | 8606 | ~17 GB |
mimo-audio | MiMo-Audio-7B | 8613 | ~18 GB |
mimo-audio-thinking | MiMo-Audio-7B-Thinking | 8614 | ~18 GB |
audio-omni | Audio-Omni | 8616 | ~24 GB |
salmonn-13b | SALMONN-13B | 8605 | ~26 GB |
audex-vllm + audex-30b-a3b | Nemotron-Labs-Audex-30B-A3B | 8618 | ~92 GB |
qwen3-omni-captioner | Qwen3-Omni-30B-A3B-Captioner | 8611 | ~61 GB |
qwen3-omni-thinking | Qwen3-Omni-30B-A3B-Thinking | 8612 | ~61 GB |
qwen3-omni | Qwen3-Omni-30B-A3B (Instruct) | 8610 | ~68 GB |
step-audio-vllm + step-audio-r1 | Step-Audio-R1.1 | 8609 | ~80 GB |
コンテナの起動状態はヘルスチェックで確認できます。
docker compose ps
# または個別に確認
curl http://localhost:8600/health
uv run streamlit run app.py
起動後、ブラウザで http://localhost:8501 にアクセスしてください。
サイドバーに各コンテナの稼働状態(🟢/🔴)と必要 VRAM が表示されます。
コンテナのホストを変更する場合 は環境変数
ARENA_API_BASEで上書きできます。
例:ARENA_API_BASE=http://192.168.1.10 uv run streamlit run app.py
各モデルの推論結果とあわせて以下のメトリクスを UI 上で確認できます。
MIT License
76 commits
Python
87.3%
Dockerfile
8.7%
Shell
4.1%