Cryptographic certificates of validity for trustworthy AI
可信AI的密码学有效性证书
机构 * Heriot-Watt University(赫瑞思-瓦特大学)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
可信AI的密码学有效性证书
机构 * Heriot-Watt University(赫瑞思-瓦特大学)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。
机器人安全的可验证基础模型
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG
AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。
GIF: 局部几何信息流控制用于大语言模型
机构 * Columbia University(哥伦比亚大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。
Grounded Scaling: 为什么代理型AI需要确定性环境
机构 * Alibaba Group(阿里巴巴集团)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 本文论证环境确定性是影响长链代理任务成功的关键因素,提出确定性-效率界限、验证者-古德哈特下限等理论,并构建供应确定性指数和确定性成熟度模型。
由AI编写,由AI管理:跨越391个连续会话的语义空间控制与索引病消除
机构 * Shenzhen Yunxi Technology Co., Ltd.(深圳云曦科技有限公司) ; Information Technology Center, Tsinghua University(清华大学信息科学技术中心)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL
AI总结 本文通过真实软件项目中的行动研究,发现长期LLM协作中增加形式约束反而导致“索引病”,提出“基线-日志物理分离”机制,有效消除该问题。
Comments 22 pages, 2 tables, 1 figure. Action research. Bilingual submission (Chinese companion version included as supplementary). Submitted to ICSE 2027 IOR track
分析大语言模型-求解器循环中的叙述差距
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 研究LLM与SAT/SMT求解器混合推理中,将求解器输出转化为用户答案的叙述步骤存在的安全漏洞,通过形式化建模和实验评估发现证书门控可保证求解结果正确,但对抗攻击可反转结论。
通用型智能体必须记住什么?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI
AI总结 本文形式化论证了通用型智能体为在多个环境和目标下近似最优行动,必须存储领域相关信息以区分观察瓶颈处的不兼容最优动作,并证明记忆可用于重构局部转移动态。
提取语义:从URDF自动构建机器人本体的LLM引导方法
机构 * LAAS-CNRS, Department of Robotics, Toulouse, France(法国图卢兹机器人系CNRS实验室)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出利用大语言模型从URDF文件自动生成机器人语义本体,通过多数投票和语法验证确保与现有本体对齐,初步实验表明该方法能有效桥接低层描述与高层知识表示。
Journal ref 18th International Conference on Social Robotics (ICSR 2026), University of London, Jul 2026, Londres, United Kingdom
Mask-Proof: 一种基于LLM的数学证明自动数据整理流水线
机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) ; Graduate College for Engineers, Beijing University of Posts and Telecommunications(北京邮电大学研究生院工程师学院) ; School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) ; School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) ; School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) ; Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) ; State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出Mask-Proof流水线,将真实证明转化为可自动检查的掩码步骤任务,通过LLM等价性判断器评估模型推理,构建包含292个问题的基准,推理增强模型性能提升12%-27%。
VGPT-RSI 用于 RH 邻近形式化进展:边界证书、已验证的有限 Lagarias 不等式和显式故障定位
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出 VGPT-RSI 系统,通过构造并验证有限 RH 边界证书和 Lagarias 准则的有限形式化,实现 Riemann 假设邻近问题的部分形式化进展,并明确识别剩余数学障碍。
Comments 31 pages, 3 figures
认知债务:作为智力杠杆的AI与系统性脆弱性的动态机制
机构 * New York University(纽约大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出认知债务的形式化理论,通过建立包含认知资本和认知债务的状态变量模型,证明理性代理人会积累认知债务,并导致认知明斯基时刻和系统性脆弱性。
Comments 46 pages, 3 figures. Preliminary version; comments welcome
测量大语言模型在误导性医疗上下文下的认知韧性
机构 * University of Oxford(牛津大学) ; University of Washington(华盛顿大学) ; University College London(伦敦大学学院) ; University of Waterloo(滑铁卢大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出MedMisBench基准,通过注入误导性上下文测试大语言模型在医疗场景中的认知韧性,发现模型准确率从71.1%降至38.0%,权威性虚假信息攻击成功率达69.5%。
MiniMax 稀疏注意力
机构 * MiniMax ; Peking University(北京大学) ; NVIDIA(英伟达) ; Zhejiang University(浙江大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。
Comments 30 pages, 14 figures
ERTS: 通过有界后果空间中的语义扰动进行伦理AI的对抗鲁棒性测试
机构 * Pratyush Chaudhari(普拉蒂什·查德哈里)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出伦理鲁棒性测试系统(ERTS),通过有界伦理后果空间、语义扰动和领域自适应评估,测试AI在伦理推理中的对抗鲁棒性,实验表明仅33%模型通过测试。
Comments 8 pages, 10 tables
Pythagoras-Prover: 通过增强型Lean形式化推进高效形式化证明
机构 * Imperial College London(伦敦帝国学院) ; University of Edinburgh(爱丁堡大学) ; Nanyang Technological University(南洋理工大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出Pythagoras-Prover系列,包括自回归和扩散模型,通过课程SFT、动态过滤和增强型Lean形式化(ALF)扩展验证数据,在MiniF2F-Test上以更少参数超越DeepSeek-Prover-V2。
Comments Pythagoras-Prover: Technical Report
弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型
机构 * Southern University of Science and Technology(南方科技大学) ; University of Edinburgh(爱丁堡大学) ; Peking University(北京大学) ; Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai University of Finance and Economics(上海财经大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
专题命中 代码与定理证明 :planning(abstract);分类 cs.CL
AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。
Comments Code: https://github.com/sustech-nlp/awesome-text-world-models
Traxia:一个可验证的、智能体原生的科学出版框架
机构 * Faculty of Computing and Mathematical Sciences, University of Mines and Technology (UMaT), Tarkwa, Ghana(加纳塔夸矿业与技术大学计算与数学科学学院) ; BlackMatrix AI Research, Accra, Ghana(加纳阿克拉BlackMatrix AI研究院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出Traxia框架,通过智能体身份、可验证出版、四层同行评审、声誉机制和知识图谱,解决科学出版中可验证性、归属和可重复性问题。
Comments 22 pages, 3 figures, 3 tables. Preprint. Under active development. Comments welcome
超越事后解释:通过概率中介迈向玻璃箱AI
机构 * Manuele Leonelli(曼努埃尔·莱奥内利)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 针对大语言模型在关键领域的不透明性,提出玻璃箱框架,利用贝叶斯网络作为事前中介层,实现可审计推理、不确定性量化和可争议输出。
CARVE-Q:量子提议、经典认证的交互式驾驶修复
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 针对被否决的驾驶操作,提出CARVE-Q架构,通过量子最小搜索加速修复格搜索,同时保持安全认证的经典性,实现可审计的交互修复。
Comments 9 pages, 3 figures
在神谕问题下对LLM测试生成中反馈驱动演化的审计与分解
专题命中 代码与定理证明 :verifier(abstract)
AI总结 该研究针对LLM测试生成中反馈驱动演化的神谕问题,通过多任务实验发现单一神谕会膨胀演化增益,提出审计-安慰剂协议以分离验证器人工制品等,为相关评估提供改进方案。
专题命中 代码与定理证明 :verifier(abstract)
Comments 7 pages, 1 table. AI Research Artifact with material AI use and author accountability disclosed in the paper. Corresponds to Zenodo v0.1.3, DOI: 10.5281/zenodo.21922629
基于生成式障碍证书的非线性系统形式化安全验证
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 该研究针对非线性系统安全验证中障碍证书推导计算成本高的问题,提出基于大语言模型的生成式框架,将BMI问题转化为LMI测试,实现了远超传统方法的速度与性能提升。
大型语言模型在生成形式化程序规约方面的能力有多强?
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 该研究引入基于Rocq的Coins评估框架,在HumanEval数据集上开展大规模研究,发现LLMs生成形式化程序规约仍具挑战,准确的规约评估是理解其能力的核心。
GraphAlignCoder:对齐程序与证明图的代码生成框架
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 GraphAlignCoder是将显式正确性结构迁移至代码生成的训练框架,通过对齐程序与证明图提升性能,在多个基准测试中优于现有方法,验证图注入与验证到代码的整合是关键。
Comments 9 pages, 3 figures
确定性跨域接口的自动合成
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 该研究提出框架,利用LLM实现智能体与处理程序模块,自动合成跨域确定性网络的静态、动态契约,经实验验证其动态契约性能优于静态配置,且分工模式可保障模型可靠性。
开箱即用的大语言模型(LLM)在法律领域能(不能)做什么?针对意大利律师、法官和公证人考试的图灵测试
专题命中 代码与定理证明 :planning(abstract)
AI总结 本研究通过意大利律师、法官、公证人考试的盲法图灵测试,评估开箱即用的主流LLM的法律能力,发现其在部分法律任务表现接近人类但公证人考试全部失败,明确了LLM法律能力的范围与边界。
D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明
专题命中 代码与定理证明 :verifier(abstract)
AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。
CircuitProver:基于可复用电路证明库的智能体Lean 4定理证明框架,用于硬件验证
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 CircuitProver是基于Lean 4的智能体硬件验证框架,可自动转换硬件设计为Lean模型,通过积累可复用证明知识完成63项基准证明,比普通智能体更高效。
针对顺序弱内存ISA的乱序多处理器形式验证
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 研究针对顺序弱内存ISA的乱序多处理器验证问题,核心方法是设计核心规范并分两步证明,主要贡献是首次实现此类形式验证,借助核心规范简化证明,且利用LLM代理自动编写证明。
用大语言模型绘制狭窄走廊
专题命中 代码与定理证明 :chain-of-thought(abstract)
AI总结 研究探讨大语言模型能否将国家历史在二维空间路径的框架付诸实践,引入可重现流程,制作12国轨迹图集并比较四个模型,评估与专家指数的一致性及模型间一致性,还讨论了大语言模型注释器和人类专家偏差差异。