We used two different techniques for quantizing these models.
Quantization-Aware Training with LoRA adaptorsprioritizing accuracy.
SpinQuant, a post-training quantization method which prioritizes portability.
Both versions are available for download as part of this release.
Two Quantization Techniques for Model Optimization Released
By
–
