文章

nano-vllm 学习笔记总览

2 分钟阅读

这里记录预计完成的功能以及是否完成,作为学习记录督促自己学习

开始时间7-12

  1. 支持更多的新模型,目前nano-vllm仅支持千问三,调整精度等等。
  • 这里我先扩充做Llama

7-13 阅读完了engine部分的代码,开始阅读qwen3的代码
7-14 作息乱了,所以看的稍微少点。阅读完了layer部分除了attention.py的代码。明天就可以开始改代码了
7-15 扩充做完了Llama,Llama不需要调整精度,这里我就略过了,明天做AWQ的 量化的扩充。但貌似明天不一定有时间,所以我打算分两天完成,边复习理论,边看vllm的代码然后迁移到自己的模型上。

  1. 增加新的量化方式
    7-16 开组会力竭了,摆了
    7-17 基本实现了AWQ,留了个小尾巴,但是AWQ的很多细节其实还是不清楚,目前只是搭了个框架,能够感受到里面还有很多细节没有吸收,明天计划把整个模型先给跑通,然后后天再沉淀一下思考一下这个量化究竟是什么东西
    7-18 实现了除了量化部分的AWQ,把流程跑通了,解决了Qwen3本身原生不支持awq的问题,跑通了代码,明确了量化部分还需要完成的部分,也就是实现具体的算子。大致的流程也已经出来了,明天把这部分实现了。我总感觉这个问题3的“attention算子性能”感觉和我现在要实现的差不多,如果真差不多就去做问题4了。希望能在7-23之前把这个项目做完。
    7-19 实现了量化部分的AWQ,速度快了一倍多,也算是做出来工作成果了。

  2. attention算子性能怎么样,找高性能算子
    我看了一下,这里实现attention的方式是直接调用的flash attention,已经够快了,没必要改,所以这个板块我先跳过

  3. 实现投机解码