QR kód

Mitigating Quantization Errors Due to Activation Spikes in Gated Linear Unit-Based Large Language Models

Modern large language models (LLMs) achieve state-of-the-art performance through architectural advancements but require high computational costs for inference. Post-training quantization is a widely adopted approach to reduce these costs by quantizing weights and activations to lower precision, such...

Celý popis

Uloženo v:
Podrobná bibliografie
Hlavní autoři: Jaewoo Yang, Hayun Kim, Junyung Ji, Younghoon Kim
Médium: Artigo
Jazyk:Inglês
Vydáno: MDPI AG 2025-04-01
Edice:Future Internet
Témata:
On-line přístup:https://www.mdpi.com/1999-5903/17/4/185
Tagy: Přidat tag
Žádné tagy, Buďte první, kdo vytvoří štítek k tomuto záznamu!