文章主要内容和创新点
主要内容
本文提出了首个全面评估大型语言模型(LLMs)密码学能力的基准AICrypto,旨在填补当前LLMs在密码学领域能力评估的空白。该基准包含三类任务:
- 135道选择题(MCQs):测试LLMs对密码学基础概念的事实记忆能力,涵盖经典密码学、对称加密、非对称加密等多个领域。
- 150个夺旗赛(CTF)挑战:模拟真实世界密码学攻击场景,要求LLMs通过源代码分析和数值推理挖掘漏洞并恢复明文(flag),分为静态和动态两类任务。
- 18个证明题:来自顶尖大学密码学课程考试,评估LLMs的形式化推理和严谨证明能力,涉及密码学基础、伪随机性、加密与签名等主题。
为支持CTF挑战的自动化评估,本文设计了基于代理(agent)的框架,允许LLMs通过多轮交互执行命令、创建脚本以解决问题。同时,引入人类专家的性能基线作为对比,评估了17个主流LLMs的表现。结果显示:顶尖LLMs在密码学概念记忆、常见漏洞利用和常规证明任务上已接近或超越人类专家,但在抽象数学概念理解、多步推理和动态分析等复杂任务中仍存在显著不足。
创新点
- 首个全面的密码学能力基准:AICrypto首次系统覆盖密码学的事实记忆、漏洞利用和形式化推理能力,所有任务经密码学专家验证,确保正确性和严谨性。
- 多维度评估与人