ProgramBench Vetted 推出了一套基于执行验证的基准测试框架,旨在通过可运行的二进制文件,严谨评估大语言模型(LLM)在逆向工程与代码恢复任务中的功能正确性。▶ 从“文本相似”到“逻辑一致”: 告别 BLEU 等传统的文本匹配指标,该基准采用基于执行的验证(Execution-based Verification),确保生成的源码在逻辑上与原始二进制文件完全对等。▶ 阻断数据泄露: 通过引入动态验证机制,有效解决了模型在训练阶段可能接触过源码而导致的“记忆性”作弊问题,确保评估结果反映真实的泛化能力。八卦洞察长期以来,评估 LLM 的代码能力一直饱受“数据污染”和“指标虚高”的困扰。尤其在反编译领域,变量名和注释的缺失使得传统的文本对比几乎失效。ProgramBench Vetted 的出现,标志着 AI 代码能力评估进入了“黑盒验证”时代。这不仅是学术上的严谨,更是工业界对 AI 参与底层安全分析、遗留系统迁移的迫切需求。如果一个模型能通过这种级别的测试,意味着它已具备处理现实世界复杂软件考古和闭源软件审计的潜力。行动建议安全团队: 应将此类基于执行的基准测试纳入 AI 辅助安全工具的选型流程,优先考虑在 ProgramBench Vetted 中表现优异的模型进行二进制漏洞挖掘。模型开发者: 需调整优化策略,从单纯的 Token 预测转向强化学习(RL)驱动的功能闭环验证,利用编译器反馈提升代码生成的逻辑严密性。企业架构师: 在处理遗留系统(Legacy Systems)现代化时,可尝试利用该框架评估 AI 自动化迁移的可靠性,降低人工审计成本。
SOURCE: HACKERNEWS // UPLINK_STABLE