5 repos
0xSero/turboquant
TurboQuant: Near-optimal KV cache quantization for LLM inference (3-bit keys, 2-bit values) with…
1,777
10 commits
krish1905/shard
No description
99
36 commits
scrya-com/rotorquant
KV cache compression via block-diagonal rotation. Beats TurboQuant: better PPL (6.91 vs 7.07), 28%…
1,048
67 commits
amirzandieh/QJL
QJL: 1-Bit Quantized JL transform for KV Cache Quantization with Zero Overhead
23 commits
ensemble-core/rvq
residual vector quantization
0
14 commits