红拂夜奔
一个小学同学突然给我发信息说他失恋了。他说他不知道为什么那个女生要离开他,或许是嫌弃他穷吧。那个女生分手的时候对他说,跟着他感觉没有未来。突然之间,在他刚开始奋斗,希望赚钱为二人拼搏出一个理想的未来的时候,女生断崖式分手。他说,我很爱那个女生,以前玩的很花,本来和这个女生也没想过走长远,但是这个女生是第一次让他感受到有人在关心他,有人在为他着想,所以他才会想…
一个小学同学突然给我发信息说他失恋了。他说他不知道为什么那个女生要离开他,或许是嫌弃他穷吧。那个女生分手的时候对他说,跟着他感觉没有未来。突然之间,在他刚开始奋斗,希望赚钱为二人拼搏出一个理想的未来的时候,女生断崖式分手。他说,我很爱那个女生,以前玩的很花,本来和这个女生也没想过走长远,但是这个女生是第一次让他感受到有人在关心他,有人在为他着想,所以他才会想…
这个博客建立的目的纯属当作记录自己当下生活和类似笔记本的平台,里面包含大量自己的主观臆断。里面的大部分观点是拾人牙慧,自己的看法也大多浅薄且偏激,不具有任何现实意义。我也无意去传播自己的思想,也不屑于拿自己的认识去洗脑别人。当你与我交流时——无论以什么方式,我都会把你看作是与我对等的,具有独立思考能力,具有主体性的,具有共情能力的个体。 博客已经将内容做好了…
好久没写了,写点东西记录一下自己的生活吧。
做一下投机解码这一块的笔记,感觉这一块还是很重要的,所以就自己实现一下。 投机解码主要的逻辑就是我如果线性的一个个的去求decode出来的token,那么GEMM就会退化成GEMV,因为是流水线型的。为了缓解这种情况所以就采取了投机解码的方式,意思是我拿一个小模型一次性的多生成几个token,然后统一的再去验证它。 这里我采取的是复现EAGLE这个方法,它是…
这里我打算围绕着AWQ去做,然后我发现AWQ在vLLM里面实际只支持FP16这个格式,如果要支持Qwen3和Llama里的BF16的格式,需要再添加一个接口做awq_marlin,这个再vLLM中也是实现了的。 考虑到模型的复杂性和我实际的工作量要求,我打算先做出来最基础的AWQ,然后在跑模型的时候强制转换格式。然后把量化这一块搞明白的差不多的时候,我再实现…
代码阅读 因为我是新手,所以先从代码阅读开始 llm_engine.py 调用链如下: LLM.generate() -> add_request() -> Sequence -> Scheduler.add() -> while not finished: -> step() -> Scheduler.schedule(…
这里记录预计完成的功能以及是否完成,作为学习记录督促自己学习 开始时间7-12
在大语言模型(LLM)的自回归生成(autoregressive decoding)过程中,每一步都会生成一个 token,并将其作为下一步的输入。为了提升推理效率,避免重复计算注意力机制中的 Key 和 Value 向量,系统会将这些中间结果缓存起来——这就是 Key-Value Cache(KV Cache)。 然而,传统的 KV Cache 管理方式存…