FEATURED · 精选文章

为什么KULLM放弃LLaMA骨干?韩国语LLM选择Polyglot-ko架构深度解析

发布时间 / 2026/8/27 17:41:29
来源 / 创域科博编辑部
栏目 / 资讯中心
为什么KULLM放弃LLaMA骨干?韩国语LLM选择Polyglot-ko架构深度解析 为什么KULLM放弃LLaMA骨干韩国语LLM选择Polyglot-ko架构深度解析【免费下载链接】KULLM☁️ 구름(KULLM): 고려대학교에서 개발한, 한국어에 특화된 LLM项目地址: https://gitcode.com/gh_mirrors/ku/KULLMKULLM구름意为云是高丽大学 NLP AI 实验室与 HIAI 研究所开发的韩国语大语言模型Korean LLM。它的核心抉择是放弃当年最火的 LLaMA 骨干改用 Polyglot-ko 12.8B 作为底座再用 LoRA 在韩语指令数据上微调并完整开源了模型、数据集与评估方法。本文带你快速读懂 KULLM 韩语 LLM 的架构选择逻辑、训练细节与 GPT-4 评估结果。 为什么韩语LLM不宜直接用LLaMA2023 年 LLaMA 发布后各国团队都想在它之上微调出本语种模型韩语团队也不例外。但 KULLM 团队在官方 README 中直接给出了结论Meta 的 LLaMA 模型作为骨干的模型经测试韩语性能不理想因此决定不公开。这背后有两条众所周知的技术原因分词器Tokenizer对韩语不友好LLaMA 的分词器主要面向英语语料训练韩语这类表音文字常被切分成大量碎片 token同等内容消耗的上下文长度成倍增加预训练语料中文占比极低底座对韩语本身的理解有限靠下游微调很难弥补先天不足。KULLM 项目的实际效果如下用韩语提问介绍一下高丽大学模型能输出结构清晰、语气自然的韩语回答☁️ Polyglot-ko为韩语而生的骨干模型KULLM 最终选择了 EleutherAI 推出的Polyglot-ko基于 GPTNeoX 架构的韩语特化 GPT作为骨干模型这也是整个项目训练脚本 finetune_polyglot.py 文件名的由来。其优势在于对比维度LLaMA 骨干Polyglot-ko 骨干韩语分词碎片化、token 浪费面向韩语优化编码效率高韩语预训练语料极少大量韩语数据预训练底座韩语理解能力弱微调难弥补强微调即可激活指令跟随KULLM 团队测试结论韩语性能差放弃✅ 采用正式发布训练入口在 finetune_polyglot.py 中一目了然默认底座就是 Polyglot-ko 12.8Bbase_model: str EleutherAI/polyglot-ko-12.8b KULLM模型家族5.8B 与 12.8B 两档尺寸KULLM 发布了多个版本全部基于 Polyglot-ko 底座 LoRA 微调KULLM-Polyglot-5.8B-v2Polyglot-ko 5.8B 韩语数据集 v2适合资源有限的部署场景KULLM-Polyglot-12.8B-v2Polyglot-ko 12.8B 韩语数据集 v2当前主力模型KULLM-Polyglot-12.8B-v1Polyglot-ko 12.8B 韩语数据集 v1基于 GPT4ALL 数据。训练采用了**参数高效微调PEFT**路线——只训练 LoRA 低秩适配器冻结骨干大参数4 张 A100 80GB 即可完成。关键超参参考 train_polyglot.shv2 模型8 个 epochv1 模型5 个 epoch学习率 3e-4、batch_size 128、micro_batch_size 4、截断长度 512LoRAr8、alpha16、dropout 0.05目标模块为query_key_value等注意力权重矩阵使用 fp16 8bit 加载load_in_8bitcosine 学习率调度 韩语指令数据集是怎么来的韩语指令数据的来源决定了模型质量。KULLM 的做法是开源数据集 DeepL 翻译数据集 v2将 GPT-4-LLM、DollyDatabricks、Vicuna 三个知名指令数据集合并并用 DeepL 翻译成韩语共152,630 条字段为instruction/input/output数据集 v1基于 GPT4ALL 翻译而来示例文件见 data/kullm-v1.jsonl评估数据集self-instruct 的人类评估集翻译版见 data/user_oriented_instructions_eval.jsonl。配套的韩语 Prompt 模板 templates/kullm.json 把 Alpaca 的经典指令格式完整翻译成了韩语아래는 작업을 설명하는 명령어와 ... 응답을 작성하세요. ### 명령어: {instruction} ### 입력: {input} ### 응답: 这个细节很关键Prompt 模板与训练数据语言保持一致避免英文模板 韩语回答的错位。 实测数据KULLM如何用GPT-4评估验证了架构选型KULLM 团队没有自说自话而是用 GPT-4 作为裁判融合 G-Eval 与 USR 评估方法实现见 scripts/evaluation/eval.py在韩语对话测试集上对比了各模型评估维度包括理解可能性0–1、自然度1–3、上下文保持1–3、趣味性1–3、指令遵循0–1、整体质量1–5类型底座模型模型理解可能性自然度上下文保持指令遵循整体质量ClosedGPT-3.5GPT-3.50.9802.8062.8490.9173.905ClosedGPT-4GPT-40.9842.8972.9440.9684.083OpenLLaMA-7bkoVicuna0.4601.5831.7260.4092.440OpenPolyglot-koKoAlpaca v1.10.6511.9091.9010.3852.575OpenPolyglot-koKULLM v20.7422.0832.1070.5483.036注意一个耐人寻味的对比同样做韩语指令微调基于 LLaMA-7b 的 koVicuna 整体质量只有 2.440而 Polyglot-ko 底座的 KULLM v2 达到3.036在全部六个维度上都是开源韩语模型第一。这正是放弃 LLaMA这一决策最有力的数据注脚 KULLM快速上手指南KULLM 基于 HuggingFace 生态部署只需三步安装依赖pip install -U torch transformers tokenizers accelerate完整依赖清单见 requirements.txt用AutoModelForCausalLM.from_pretrained加载nlpai-lab/kullm-polyglot-5.8b-v2推荐 fp16 low_cpu_mem_usageTrue配合 utils/prompter.py 中Prompter(kullm)构造韩语 Prompt推理时temperature0.2、num_beams5效果较稳。微调自己的模型时从 run_sft.sh 与 finetune_polyglot.py 入手即可复现官方训练流程LoRA 权重合并则参考 merge_lora.py。️ 核心文件导航资源路径LoRA 微调训练入口finetune_polyglot.py训练启动脚本train_polyglot.sh韩语 Prompt 模板templates/kullm.jsonPrompt 构造与推理工具utils/prompter.py韩语指令数据集 v1data/kullm-v1.jsonl韩语评估数据集data/user_oriented_instructions_eval.jsonlGPT-4 对话评估脚本scripts/evaluation/eval.py分词器合并工具merge_tokenizer/merge_tokenizers.py✅ 小结骨干选型先于一切KULLM 给韩语 LLM 开发者最重要的启示就一句话先选对底座再谈微调。LLaMA 虽然名气大但韩语分词与预训练语料的短板让它难以胜任韩语任务而 Polyglot-ko 这类为韩语而生的骨干配合 LoRA 轻量和开源指令数据就能在 GPT-4 的盲评中全面超越同类韩语模型。对于其他语言日语、越南语等的 LLM 建设者KULLM 这条原生语骨干 数据翻译 LoRA LLM-as-Judge的技术路线同样值得借鉴。【免费下载链接】KULLM☁️ 구름(KULLM): 고려대학교에서 개발한, 한국어에 특화된 LLM项目地址: https://gitcode.com/gh_mirrors/ku/KULLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻