全部文章
从最新的观察到最早的记录,这里不截断。
贰
最新文章
162026·09 KV 缓存量化压低长对话显存,Key 和 Value 要分开处理KV 缓存量化能减少长上下文和高并发推理的显存占用;KIVI 的实验说明 Key 与 Value 分布不同,量化维度也应分开选择。 白话入门 162026·09 Medusa 用多个预测头并行猜后文,猜得多还要验得快Medusa 给大模型增加多个预测头,一次提出并验证多条后续 Token 候选;接受率、验证开销和训练方式共同决定加速幅度。 白话入门 162026·09 多词元预测让训练同时看几步以后,小模型未必占便宜多词元预测让共享主干同时预测多个未来 Token,可改善大模型的代码任务并支持自推测解码;收益会随模型规模、任务与预测步数变化。 白话入门 162026·09 深度混合让部分 Token 跳过计算,固定预算仍靠路由分配深度混合为每层设定 Token 容量,只让路由器选中的位置经过注意力与 MLP;总计算量可预测,具体哪些 Token 多算会随上下文变化。 白话入门 162026·09 预填充解耦把输入和输出分给不同 GPU,KV 传输也要算预填充解耦让不同 GPU 分别处理输入和逐词生成,可以单独调节首词元与逐词延迟;两组设备之间传 KV 缓存,带宽和放置方式决定收益。 白话入门 152026·09 上下文并行沿长序列分工,注意力仍要交换完整信息上下文并行把一条长输入分到多张 GPU,降低每张卡的激活占用;注意力仍需取得全序列的键和值,通信方式决定实际收益。 白话入门 152026·09 专家并行把不同专家放到不同卡,路由之后还要搬 Token专家并行把混合专家模型的参数分散到多张 GPU,路由器选中专家后还要发送并收回 Token;负载偏斜和设备通信会直接拖慢运行。 白话入门 152026·09 分块预填充把长输入拆开算,块大小要同时照顾两种等待分块预填充把长提示词分几轮建立 KV 缓存,让正在生成的请求有机会穿插执行;块太大或太小都会改变首词元与逐词延迟。 白话入门 152026·09 张量并行把一层模型分给多张卡,通信速度决定扩展上限张量并行把同一层的矩阵运算拆到多张 GPU,再用集合通信拼回结果;它能容纳更大模型,也会把设备互连放进每层延迟。 白话入门 152026·09 首词元延迟量的是开口前等待,吞吐高也可能让人等很久首词元延迟记录请求发出到第一个输出到达的时间,里面混着排队、预填充和网络;评测要统一测量点,并同时查看尾部延迟。 白话入门