Google sort Gemma 4 en quantization-aware training
Google publie des checkpoints QAT pour cinq tailles de Gemma 4 (E2B à 31B). La quantization simulée pendant l'entraînement préserve la qualité au format Q4_0 et divise par trois la VRAM ; le E2B texte tient sous 1 Go via un format mobile dédié. Intégration immédiate dans llama.cpp, Ollama, vLLM, MLX et Unsloth — qui note qu'une conversion naïve vers GGUF perd de la précision.