Qwen3.8-27B abliterated FP8 版本近日在开源社区发布,该模型通过正交化拒绝向量技术,在保持 MMLU 和 GSM8K 等核心能力指标波动不足 1.3 分的前提下,将针对 AdvBench 和 HarmBench 等有害指令集的拒绝率从原始版本的 64-99% 骤降至 0-6%。
▶ 外科手术式剥离:“消融”(Abliteration)技术证明了可以在不破坏模型逻辑推理链条的情况下,精准移除 RLHF 引入的安全护栏。
▶ 安全与智能的解耦:实验数据表明,当前大模型的“安全性”更像是一层覆盖在智能之上的“面具”,而非内生于权重的逻辑,这为模型对齐研究提供了全新的视角。
八卦洞察
此次 Qwen3.8-27B 的测试数据揭示了一个残酷的现实:所谓的“安全对齐”在技术层面极其脆弱。当拒绝率从近乎百分之百下降到个位数,而模型在复杂推理(GSM8K)上的表现依然稳健时,这意味着安全训练并未触及模型的认知核心。对于全球 AI 监管者而言,这无疑是一个警钟——仅仅依靠厂商在权重层面的“对齐”来保证开源模型的安全性已不再可靠。这种“无损去对齐”的能力,预示着开源模型治理将从“权重封锁”转向“运行时监控”的新阶段。
行动建议
对于开发者和企业架构师,建议放弃对模型原生安全对齐的过度依赖。在生产环境中,应将安全防御逻辑从模型内部抽离,构建独立的外置护栏(如部署 Llama Guard 3 或自研审核 RAG 流程)。同时,研究人员应关注“消融”技术在消除模型过度偏见、提升特定垂直领域(如医疗咨询)回答率方面的正向应用潜力,而非仅仅局限于红队攻击。
SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE