speculative-decoding
Accelerate LLM inference using speculative decoding, Medusa multiple heads, and lookahead decoding techniques. Use when optimizing inference speed (1.5-3.6× speedup), reducing…
- Industry
- research
- License
- Unverified
- Source repo
- Orchestra-Research/AI-Research-SKILLs · ★ 10,718
- Source file
- 19-emerging-techniques/speculative-decoding/SKILL.md
不会安装?看中文图文教程 →