[ DATA_STREAM: %E6%9D%83%E9%87%8D%E5%90%88%E5%B9%B6 ]

权重合并

SCORE
8.8

AntLing 开源 Ling-3.0 原始权重:以 WSM 权重合并技术重塑持续预训练范式

TIMESTAMP // 8 月.19
#大语言模型 #开源模型 #持续预训练 #权重合并

核心事件 AntLing 正式开源 Ling-3.0-tiny 与 Ling-3.0-flash 系列的 6 个基础模型 Checkpoint,涵盖预训练、中段训练及 WSM 合并阶段,旨在为全球开发者提供未经后训练处理的纯净研究起点。 ▶ 全链路透明化:开源涵盖了从 Pre-trained 到 WSM-merged 的完整阶段,允许研究者在模型生命周期的任何节点介入。 ▶ WSM 技术革新:引入加权检查点合并(Weighted Checkpoint Merging)替代传统的学习率衰减(LR Decay),显著提升了持续预训练的灵活性。 八卦洞察 在当前大模型开源界,多数厂商仅提供最终版的 Base 或 Chat 模型,这种“黑盒”交付限制了社区对模型演化路径的探索。AntLing 此次开源的深层意义在于其对持续预训练(Continual Pre-training)痛点的精准打击。传统的 LR 衰减策略一旦确定,模型在面对新领域数据时往往难以兼顾旧知识与新学习率的匹配。而 WSM 技术通过合并不同阶段的 Checkpoint,实际上是在“离线”状态下模拟了衰减过程。这意味着开发者无需支付昂贵的重新训练成本,即可通过调整合并权重来探索最优的衰减曲线。这种做法将模型训练从一种“线性不可逆”的过程,转变为一种“可回溯、可组合”的实验,极大地降低了垂直领域模型适配的门槛。 行动建议 对于追求极致垂直领域性能的团队,建议放弃从最终版 Base 模型开始微调,转而采用 Ling-3.0 的中段训练(Mid-trained)Checkpoint。通过引入 WSM 策略,将自有领域数据与 AntLing 的原始权重进行加权融合,可以在保持模型通用推理能力的同时,更高效地注入行业知识。此外,学术界应重点关注其统一训练方案在不同规模(Tiny vs Flash)模型上的表现差异,这对于研究模型缩放定律(Scaling Laws)具有极高的参考价值。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE