ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

70亿token喂出来的韩语大语言模型:KoGPT-J-base训练数据集完整指南

70亿token喂出来的韩语大语言模型:KoGPT-J-base训练数据集完整指南 70亿token喂出来的韩语大语言模型KoGPT-J-base训练数据集完整指南【免费下载链接】kogpt-j-base项目地址: https://ai.gitcode.com/hf_mirrors/CICC/kogpt-j-baseKoGPT-J-base 是一个基于 GPT-J 架构的韩语大语言模型用约 70 亿个 token 的韩语训练数据集练成能做韩语文本生成与理解。这篇指南从教材来源、训练细节讲到本地跑通一次说清。KoGPT-J-base韩语大模型70亿token训练数据集语料构成示意占位图建议补图四类韩语训练数据的规模占比图尺寸不小于 600×300 KoGPT-J-base 是什么定位一句话可直接加载的开源韩语生成模型。权重同时提供 PyTorchpytorch_model.bin和 Flaxflax_model.msgpack两种格式所有架构参数写在config.json里。分词器使用 GPT2Tokenizer把韩文切分成模型可读词元的组件词表基本都服务于韩文。核心参数速览参数数值Transformer 层数12 层隐藏维度768总参数量1.63 亿163M词表大小51,200最大上下文长度为 1,024 个 token。1.63 亿参数是什么概念如今动辄千亿参数的大模型像一座图书馆KoGPT-J-base 更像一台装满高频韩语书的移动书柜容量不算大但每本书都是反复出现过的韩语文本查得快、部署也快。 70亿token的训练数据从哪来把训练数据当成给模型备教材四类语料各补一块教材来源规模补什么AIHub 官方数据集SNS 对话、口语、图书、网页约 14.7GB日常口语语感韩语维基百科 나무위키约 7.3GB百科事实知识国立国语院语料新闻、书面、口语、对话约 21.2GB规范书面表达青瓦台国民请愿525MB正式请求语体分工很清楚AIHub 那份决定韩国人平时怎么说话对话、口语、网页文本混在一起口语感最强韩语维基和 나무위키 提供条目化的事实知识国立国语院是最大的一份新闻语料覆盖到 2022 年决定书面表达是否规范国民请愿量最小却补上了日常文本里稀有的正式请求语体。四类来源刻意错开腔调——商业平台对话、公共百科、政府标准语料、公民请愿避免模型只学会一种口吻。所有材料先做清洗和预处理统一转成 JSONL 格式纯文本文件一行一个样本合计约 70 亿个 tokentoken 是模型处理文本的最小单位。⚙️ 它是怎样练成的训练平台是 TPU V2-8 集群TPU 是谷歌的 AI 加速芯片V2-8 即 8 芯一组2023 年 2 月 16 日至 18 日共 2 天 22 小时、43,247 步。训练超参数速览项目配置优化器 / 学习率AdamWβ10.9β20.98权重衰减 0.01学习率 6e-4线性调度预热 1,000 步批大小 / 轮次51264 步梯度累积 × 8 设备3 个 epoch即整份教材完整读 3 遍AdamW 是在 Adam 基础上加权重衰减的优化器6e-4 这个学习率对 1.6 亿参数的小模型属于大步快跑靠 1,000 步预热前 1,000 步先小步试探稳住开头再用线性调度逐步收回。也就是说每步攒够 64 个小批、8 台设备并行70 亿 token 的教材读满 3 遍就是这次训练的全部故事。 跑起来要几步本地跑通第一次推理韩语大模型怎么用三步就够。依赖清单在examples/requirements.txt示例脚本examples/inference.py就是一次完整的推理调用自动检测设备有 NPU——神经处理单元类似 GPU 的专用加速硬件——就用 NPU没有就退回 CPU对文本生成管道输入韩语提示词续写 128 个 token 并打印结果。git clone https://gitcode.com/hf_mirrors/CICC/kogpt-j-base cd kogpt-j-base python examples/inference.py跑通后终端会打印三组韩文续写第一组以안녕하세요开头是对话腔的自我介绍式文本。KoGPT-J-base韩语大模型本地推理输出效果示意占位图建议补图终端运行examples/inference.py后韩文续写结果的截图⚖️ 它能做什么、又有哪些短板能力具体能干什么边界要设防什么新闻摘要、故事续写、邮件与文案起草等韩语文本生成训练数据未做仇恨/歧视内容清洗输出可能夹带偏见表述上线前需人工审核客服机器人、聊天助手等对话场景可能对特定人物、种族、性别、残障群体生成刻板印象同时覆盖书面语与口语正式、随意场合都能接语料几乎全为韩语跨语言能力基本没有README 的注意事项写得很直白训练语料里可能混着歧视、仇恨类内容且没有专门做过滤所以生成结果需要审核兜底。❓ 你可能关心的问题KoGPT-J-base 能商用吗能。仓库声明 Apache-2.0 许可商用、非商用都不受限二次分发时保留许可声明即可。不过输出可能带偏见见上一节安全责任在部署方。只支持韩语吗基本是韩语专用训练数据全部是韩语51,200 的词表也是面向韩文构建的其他语言的效果没有保证。想覆盖多语言得自备对应语种语料继续训练。必须用 NPU 吗不需要。示例代码用is_torch_npu_available()自动判断有 NPU 走 NPU没有就落 CPUCPU 上 1.63 亿参数跑得动只是批量推理速度有限。PyTorch 与 Flax 两套权重都在仓库里框架二选一。想确认它合不合用最省事的办法是克隆仓库后直接跑examples/inference.py把提示词换成你自己业务里的真实韩语句子试一组。生成质量过关再谈领域微调或接入产品。【免费下载链接】kogpt-j-base项目地址: https://ai.gitcode.com/hf_mirrors/CICC/kogpt-j-base创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表