Codice QR

Fast collaborative inference via distributed speculative decoding

Speculative decoding accelerates Large Language Model (LLM) inference by allowing a lightweight draft model to predict multiple future tokens that are subsequently verified by a larger target model. In AI-native Radio Access Networks (AI-RAN), this mechanism naturally enables device-edge collaborati...

Descrizione completa

Salvato in:
Dettagli Bibliografici
Autori principali: Ce Zheng, Ke Zhang, Chen Sun, Wenqi Zhang, Qiong Liu, Angesom Ataklity Tesfay
Natura: Artigo
Lingua:Inglês
Pubblicazione: KeAi Communications Co., Ltd. 2026-01-01
Serie:Journal of Information and Intelligence
Soggetti:
Accesso online:http://www.sciencedirect.com/science/article/pii/S2949715925000782
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!