ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Understanding Subword Compositionality of Large Language Models

Understanding Subword Compositionality of Large Language Models 文章总结与翻译一、主要内容本文围绕大型语言模型(LLMs)的子词组合性展开研究,旨在探究LLMs如何将子词表示有效组合成有意义的词级表示,主要从结构相似性、语义可分解性和形式保留三个关键维度展开实验分析,涉及5个LLM家族的6个指令微调模型(Llama3-8B-Instruct、Llama3.1-8B-Instruct等)。1. 研究背景LLMs严重依赖子词分词技术,该技术可能破坏语素边界,但LLMs仍能出色理解词义,这表明其并非仅依赖记忆(因记忆在输入长度和词汇量增长时计算不可行),而是采用系统的子词组合策略,这一现象推动了对LLMs子词组合机制的研究。2. 核心实验与发现几何分析:通过普罗克拉斯提斯分析量化子词组合表示与原词表示的结构相似性,发现简单加法运算生成的组合表示在所有模型和层中均优于乘法、绝对差等运算;6个模型可分为三组,每组在层间结构相似性演化上呈现不同模式(如Aya - expanse和Gemma2在各层均保持高结构相似性,Llama模型仅在嵌入层有中等结构相似性且迅速下降);此外,指令微调对结构相似性模式影响小,预训练才是关键因素;非根词(可分解为更小有意义单元)比根词(最小意义单元)结构相似性更高;语境化能提升部分模型(如Llama)的结构相似性。探测分析:语义可分解性(根词与非根词分类):将任务设为二分类,用逻辑回归模型训练,结果
返回列表