Mitigating Quantization Errors Due to Activation Spikes in Gated Linear Unit-Based Large Language Models
Modern large language models (LLMs) achieve state-of-the-art performance through architectural advancements but require high computational costs for inference. Post-training quantization is a widely adopted approach to reduce these costs by quantizing weights and activations to lower precision, such...
Salvato in:
| Autori principali: | , , , |
|---|---|
| Natura: | Artigo |
| Lingua: | Inglês |
| Pubblicazione: |
MDPI AG
2025-04-01
|
| Serie: | Future Internet |
| Soggetti: | |
| Accesso online: | https://www.mdpi.com/1999-5903/17/4/185 |
| Tags: |
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
