Construction-Verification: A Benchmark for Applied Mathematics in Lean 4
构造-验证:Lean 4中的应用数学基准
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出Lean 4中的构造-验证框架,通过AMBER基准评估应用数学领域中显式解决方案合成与验证能力,揭示通用模型在复杂构造任务中的优势。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
构造-验证:Lean 4中的应用数学基准
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出Lean 4中的构造-验证框架,通过AMBER基准评估应用数学领域中显式解决方案合成与验证能力,揭示通用模型在复杂构造任务中的优势。
代理雾:一种基于策略的雾计算分布式智能框架
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出了一种基于策略的雾计算框架,通过将雾节点建模为自主代理并利用势博弈理论,实现了动态环境下的高效资源管理和稳定系统收敛。
Comments 09 Pages
利用LLMs和测试或acles自动生成形式规范和验证注解
专题命中 代码与定理证明 :verifier(abstract)
AI总结 本文利用LLMs和测试或acles自动为Dafny程序生成形式规范和验证注解,实验表明该方法在多数情况下有效,并展示了IDE集成的可行性。
增强知识图谱查询利用大语言模型
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 SparqLLM通过结合RAG和LLM技术,实现高效的知识图谱查询与可视化,提升非专家用户的数据交互能力。
Journal ref 2025 International Joint Conference on Neural Networks (IJCNN)
汽车行业中测试用例规范技术与系统测试工具:综述
专题命中 代码与定理证明 :planning(abstract)
AI总结 本文通过系统文献综述和行业经验,综述了汽车行业测试用例规范技术与系统测试工具的挑战与需求,提出了优先级标准目录,支持技术选择和未来测试框架改进。
Comments This is the author accepted manuscript (AAM) of a paper accepted for publication in The Journal of Systems and Software (Elsevier). The final published version will be available via the journal
人类挑战Oracle:设计抗AI、身份绑定、时间限制的任务以实现抗Sybil共识
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出HCO,一种通过时间限制、身份绑定挑战来对抗Sybil攻击的新型安全机制,旨在提升共识系统的抗AI能力。
Comments 21 pages, 4 tables. Initial preprint
代理证明自动化:一个案例研究
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本研究提出代理证明自动化方案,利用LLM代理高效完成证明工程任务,通过案例研究展示其在形式化系统中的应用与成效。
FICO:有限时间闭环因子分解用于统一多智能体路径寻找
专题命中 代码与定理证明 :planning(abstract)
AI总结 FICO通过系统级建模和闭环设计,实现了多智能体路径寻找问题的高效解决,显著提升了计算效率和适应性。
对LLM控制的机器人信任:安全威胁、防御和挑战的综述
机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) ; Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) ; Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) ; School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。
文化进化建模
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出了一种文化进化建模的通用模板,通过动态循环连接系统状态、认知过程、行为和宏观结果,以理解文化变化的多元但一致的机制。
Comments Chapter in Johan Lind and Anna Jon-And, eds.: Cultural Evolution from Minimal Principles, Cambridge University Press
反事实伤害:一种反论点
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文指出基于反事实的伤害定义在多治疗选项场景下会产生不一致性,提出基于预期效用的干预定义以确保治疗排名的传递性。
当自然策略与模糊性及资源受限行动相遇(扩展版本)
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出HumanATLF逻辑,结合模糊语义和资源受限行动,解决自然策略中成本和不确定性的问题,并证明模型检查的复杂性。
为Isabelle/HOL上的神经定理证明设计的最小化证明语言
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出Minilang,一种简洁的证明语言,用于提升神经定理证明在形式证明中的性能。
Comments Accepted in OOPSLA'26
重新审视LLM聊天机器人中的会话规范以实现可持续AI
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文探讨了LLM聊天机器人中会话规范对可持续性的影响,指出交互行为、对话模式、用户习惯及上下文积累是影响系统能耗的关键因素,需重新设计交互方式以实现可持续发展。
Kimina Lean Server: 一种高性能的大型验证用Lean服务器
专题命中 代码与定理证明 :verifier(abstract)
AI总结 Kimina Lean Server通过高效的并行处理和缓存机制,提升了大规模验证和数据提取的效率,适用于强化学习管道中的高性能验证任务。
Comments Accepted to the 5th MATH-AI Workshop at NeurIPS 2025
超越 hype:批判性分析高等教育中教育 AI 使用的学生动机与伦理边界
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文探讨高等教育中学生使用 AI 的动机与伦理问题,指出学生普遍依赖 AI 工具但缺乏指导,女性更关注 AI 滥用风险,提出通过 AI 文化课程和评估改革促进负责任的 AI 采用。
Comments 14 pages, 3 figures
从节目到数据:设计一种工作流,通过语言模型使表演艺术的临时性资料可访问
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出利用多模态语言模型和本体推理模型,将戏剧节目转化为结构化数据,以提升文化遗产资料的可访问性和分析能力。
Comments 19 pages, 8 figures, 5 tables, 17 references
在初级课程中系统思考代码结构练习的复杂性
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出一个框架,用于系统评估初级课程中代码结构练习的复杂性,通过定义重复、代码模式和数据依赖性三个维度,帮助设计提升学生分解与抽象能力的教育任务。
对Sigmoid函数的正式分析及通用逼近定理的正式证明
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文在Isabelle/HOL中形式化分析了Sigmoid函数并证明了通用逼近定理,填补了形式化证明库的空白,提升了神经网络的可信度。
Comments 1 figure
以人为中心的AI意识伦理争论框架
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出以人为中心的AI意识伦理框架,通过哲学不确定性的三级结构,确立无意识假设、风险谨慎和透明推理原则,以平衡哲学严谨性与实践指导,为AI伦理问题提供负责任的演进路径。
智能用户界面能否参与哲学讨论?哲学家们观念演变的纵向研究
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本研究通过纵向研究探讨哲学学者对生成式AI智能用户界面参与哲学讨论态度的演变,发现其从抵制到接受再到质疑的三阶段变化,揭示IUI在哲学推理中的局限性。
通过纤维化实现更高阶的行为一致性
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出了一种统一的范畴方法,通过纤维化实现高阶语言的行为一致性,证明了最大行为一致性在一般条件下的合同性质。
LLMs作为固件专家:一种运行时增长的代理树框架
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出FIRMHIVE框架,利用LLMs作为固件安全分析师,通过递归代理蜂群实现更深入的固件漏洞检测,提升漏洞识别率和精度。
Comments 18 pages, 13 figures
BOOP:写出正确的代码
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 BOOP通过结构化框架提升编程教育中的计算思维能力,强调正确性优先的开发方法。
专题命中 代码与定理证明 :verifier(abstract)
专题命中 代码与定理证明 :reasoning(abstract)
Comments Accepted at the Annual Computer Security Applications Conference (ACSAC) 2025
专题命中 代码与定理证明 :reasoning(abstract)
专题命中 代码与定理证明 :reasoning(abstract)
Comments 12 pages, 7 figures. Camera-ready version. Accepted to the 5th International Workshop on Scientific Knowledge: Representation, Discovery, and Assessment; 2 November 2025 - Nara, Japan; co-located with The 24th International Semantic Web Conference, ISWC 2025. Published in CEUR proceedings Vol-4065, pages 45-56
机构 * Microsoft Research, Redmond(微软研究院(红mond)) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 代码与定理证明 :reasoning(abstract)
Comments Project Page: https://praeclarumjj3.github.io/visper_lm/
专题命中 代码与定理证明 :reasoning(abstract)