ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

On-device System of Compositional Multi-tasking in Large Language Models

On-device System of Compositional Multi-tasking in Large Language Models 该文章提出了一种适用于大语言模型的设备端组合多任务处理系统,核心是通过新增投影层整合单任务LoRA适配器,在保证性能的同时降低计算与存储开销,并开发了Android应用验证其可行性。一、文章主要内容总结研究背景与问题现有大语言模型(LLMs)多依赖远程服务器,设备端部署因隐私保护、低延迟需求逐渐受关注,但1B-3B参数的设备端模型在处理“生成多语言对话摘要”等组合任务时存在挑战。传统方法要么需重复训练专用LoRA(存储开销大),要么需分阶段推理(耗时),无法兼顾性能与效率。核心方法提出“投影融合(Projection Merge)”策略:在摘要和翻译两个单任务LoRA适配器的基础上,新增低秩投影层(参数仅0.1M,存储0.2MB),通过公式ΔW=P₂P₁(0.5B₁A₁+0.5B₂A₂)整合适配器参数,实现单次推理完成组合任务。构建设备端系统:后端用Rust开发,前端用React Native,基于mistral.rs库管理模型与适配器,解决了适配器集成、模型加载、内存管理三大技术难题。实验与结果模型与数据:采用Llama-3.2-1B-Instruct模型,在SAMSum对话摘要数据集、TEDTalks英西翻译数据集上训练,4位量化(Q4_K_M)后部署于三星S23 Ultra。性能表现:在组合任务(英文对话→西班
返回列表