Language Model Inference Optimization

48 repos across 2 sub-areas

Techniques and implementations for accelerating large language model inference through speculative decoding, quantization, and efficient text generation. The cluster centers on optimized model variants (Qwen and Gemma series) using quantization formats like 4-bit and specialized inference frameworks, with a focus on reducing latency and memory overhead while maintaining generation quality. Repositories demonstrate practical applications of these optimization strategies across different model architectures and sizes.