61
stars
10
commits
9
repos using this model
2
linked in READMEs
Apr 15, 2025
updated
4 commits
1 commits
sail/longspec-longchat-7b-v1.5-32k
0
NTU-NLP-sg/flan-llama-7b-10m-delta
xinlai/Llama-3-70B-SFT
chitanda/panda-7b-open-llama-preview-300pt
kuleshov/llama-7b-4bit
12
llamaste/Llama-2-7b-chat-hf
4,838
meta-llama/Llama-2-7b-chat-hf
relaxml/Llama-2-7b-chat-E8PRVQ-3Bit
FibonaccciYan/Adamas
Adamas: Hadamard Sparse Attention for Efficient Long-context Inference
15
jy-yuan/KIVI
[ICML 2024] KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
432
amirzandieh/QJL
QJL: 1-Bit Quantized JL transform for KV Cache Quantization with Zero Overhead
100
pku-liang/ArkVale
ArkVale: Efficient Generative LLM Inference with Recallable Key-Value Eviction (NIPS'24)
55
SalesforceAIResearch/ThinK
ThinK: Thinner Key Cache by Query-Driven Pruning
30
ydyhello/TailorKV
Official implementation of "TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV…
21
casys-kaist/oaken
Artifact for Oaken: Fast and Efficient LLM Serving with Online-Offline Hybrid KV Cache Quantization
18
gpzlx1/HATA
13
wenhaoli-xmu/tokenmix2
sail-sg/LongSpec
[ACL 2026 (Main)] LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and…
86