
发布了3.0 GGUFs, 这是借助动态量化技术的GGUFs模型, 提及动态量化, 要说, 在量化训练之际, 依据不同层级及参数具有的重要性, 去采用不一样的量化精度。主要服务在于对本地设备开展推理优化, 因而所有的目标是于尽可能维持原始精度的情形下, 削减显存的占用。3.主要的技术做了这样的事, 引入了一个校准数据集, 运用PTQ量化技术采取分层级量化方式, 未采用QAD/QAT量化, 并且过拟合问题表现得不算明显 , 且此技术为0。表明在top - 1% 的那种精度、KL指标方面维持着相当高的质量, 跟其他厂商所拥有的量化模型相比较而言, top - 1这一精度提升了10%, top - 1意味着是把量化模型同BF16原始模型去做比较, 在每一次next token产生的时候, 两者当中最高概率的那个token是否为同一个。仅仅这top - 1%精度, 仅能诉说单个token的概率情形, 无法展现实际的推理成效, 鉴于在token迭代生成进程里, 还易于偏离正轨。所以弄出了一个新评测标准 - 30032。-30032, 从 -Bench 2.如 1 类 等数据集当中, 去选取 300 条数据, 并且, 要和 BF16 精度、其他量化厂商所提出的方案进行比较, 使模型不停地连续进行有着 32 个 token 的相关操作, 之后, 再去比较概率, 下图呈现的便是具体的结果:可以看出在不同厂商量化的模型中 3.0 效果最好。当下, 那些量化后的模型, 均能够在llama.cpp以及其他相关平台上得以运行, 你可以前往查看一番实际呈现出的效果。