18 repos
Large language model implementations, inference optimization, and evaluation frameworks. This cluster centers on modern LLM architectures (DeepSeek, MiniMax) with emphasis on efficient quantization (FP8), model serialization via safetensors, and transformer-based implementations. Repositories focus on deployment-ready models with standardized endpoints, evaluation results tracking, and inference optimization techniques for production use.