WebGPU + ONNX Runtime Web を使って、ブラウザ内だけで LLM 推論を行うチャットデモ。
サーバーサイドの推論は一切不要。ユーザーの GPU でモデルが動く。
make dev
http://localhost:3000 にアクセス。
初回はモデルのダウンロード(約 2GB)が走るため数分かかる。2 回目以降はキャッシュから読み込まれる。
| コマンド | 内容 |
|---|---|
make dev | ビルド&起動 |
make stop | 停止 |
make build | イメージのビルドのみ |
make clean | イメージの削除 |
3 commits
JavaScript
83.1%
CSS
10.8%
HTML
4.2%
Makefile
1.2%
WebGPU + ONNX Runtime Web を使って、ブラウザ内だけで LLM 推論を行うチャットデモ。
サーバーサイドの推論は一切不要。ユーザーの GPU でモデルが動く。
make dev
http://localhost:3000 にアクセス。
初回はモデルのダウンロード(約 2GB)が走るため数分かかる。2 回目以降はキャッシュから読み込まれる。
| コマンド | 内容 |
|---|---|
make dev | ビルド&起動 |
make stop | 停止 |
make build | イメージのビルドのみ |
make clean | イメージの削除 |
3 commits
JavaScript
83.1%
CSS
10.8%
HTML
4.2%
Makefile
1.2%