Collaborative Large Language Model Inference via Resource-Aware Parallel Speculative Decoding 一、文章主要内容总结该研究聚焦于资源受限场景下的设备端大语言模型(LLM)推理优化,提出了一种基于移动边缘计算(MEC)的协同推理框架,核心解决传统推理方案(设备端本地推理、云端推理)的性能瓶颈(如设备内存不足、云端延迟高)及推测解码技术在MEC场景中的通信开销、异步延迟问题。核心背景与问题:设备端LLM推理存在计算/内存消耗大、电池损耗快等问题(如Llama2-7B需28GB内存);云端推理则面临延迟、带宽成本及隐私风险。现有推测解码通过“轻量草稿模型(设备端)+ 高性能目标模型(边缘服务器)”分工生成令牌,但存在双向等待(传统方案)或通信开销(并行方案)问题;并行推测解码(PSD)虽能重叠计算阶段,但需解决设备计算与上行通信的同步及资源分配优化。技术方案:提出统一的用户关联与资源分配(UARA)优化框架,结合两阶段匹配关联(TMA)和多智能体软演员-评论员(MASAC)强化学习算法。系统模型包含M个移动设备和E个边缘服务器,采用时隙化模型适配用户移动性和时变信道条件,同时考虑设备剩余电量等约束。基于Sionna模拟器构建高保真实验环境,模拟射线追踪、地理定位无线信道等真实场景。实验结果:相比随机关联、最大SINR、最大计算能力三种基线方案,该框架在不损失推理精度的前