Chapter 61
Triton
吞吐量
延迟
投机采样:
美杜莎:
-
Medusa: Simple Framework for Accelerating LLM Generation with Multiple Decoding Heads
-
OpenLLM: https://github.com/bentoml/OpenLLM
加载中...
目录
Chapter 61
吞吐量
延迟
投机采样:
美杜莎:
Medusa: Simple Framework for Accelerating LLM Generation with Multiple Decoding Heads
OpenLLM: https://github.com/bentoml/OpenLLM