arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1129 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2606.23913 2026-06-24 cs.LG 新提交 57%

Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI

闭环:形式化验证的法律作为自我改进法律AI的奖励信号

Armin Heydari, Torben Leowald

机构 * Harvard University(哈佛大学) Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG

AI总结 提出一种架构,通过LLM驱动的形式化转换和验证内核,为法律AI提供可验证的奖励信号,实现闭环强化学习,并在多个法律领域展示其优势。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23768 2026-06-24 cs.CR cs.AI cs.LO 新提交 57%

Cryptographic certificates of validity for trustworthy AI

可信AI的密码学有效性证书

Murdoch J. Gabbay

机构 * Heriot-Watt University(赫瑞思-瓦特大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 57%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23277 2026-06-23 cs.AI 新提交 57%

GIF: Locally Sound Geometric Information Flow Control for LLMs

GIF: 局部几何信息流控制用于大语言模型

Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22495 2026-06-23 cs.AI 新提交 57%

Grounded Scaling: Why Agentic AI Needs Deterministic Environments

Grounded Scaling: 为什么代理型AI需要确定性环境

Liang Ding, Xintong Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文论证环境确定性是影响长链代理任务成功的关键因素,提出确定性-效率界限、验证者-古德哈特下限等理论,并构建供应确定性指数和确定性成熟度模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19121 2026-06-23 cs.SE cs.CL cs.HC 新提交 57%

Written by AI, Managed by AI: Semantic Space Control and Index Sickness Elimination Across 391 Consecutive Sessions

由AI编写,由AI管理:跨越391个连续会话的语义空间控制与索引病消除

Hui Zhang, Shuren Song

机构 * Shenzhen Yunxi Technology Co., Ltd.(深圳云曦科技有限公司) Information Technology Center, Tsinghua University(清华大学信息科学技术中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文通过真实软件项目中的行动研究,发现长期LLM协作中增加形式约束反而导致“索引病”,提出“基线-日志物理分离”机制,有效消除该问题。

Comments 22 pages, 2 tables, 1 figure. Action research. Bilingual submission (Chinese companion version included as supplementary). Submitted to ICSE 2027 IOR track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19331 2026-06-23 cs.CL 版本更新 57%

Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

评估基于大语言模型的议会辩论总结的论证内容

Eoghan Cunningham, Derek Greene, James Cross, Antonio Rago

机构 * School of Computer Science, University College Dublin(都柏林大学计算机科学学院) School of Politics and International Relations, University College Dublin(都柏林大学政治与国际关系学院) Department of Informatics, King’s College London(伦敦国王学院信息学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种评估议会辩论总结的框架,通过计算论证方法评估总结对辩论论证内容的忠实性,以欧洲议会辩论为例验证方法有效性。

Comments Accepted at KR'26 In The Wild Track. Camera Ready with additional supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19588 2026-06-19 cs.AI cs.CR cs.LO 新提交 57%

Analyzing the Narration Gap in LLM-Solver Loops

分析大语言模型-求解器循环中的叙述差距

Zunchen Huang, Songgaojun Deng

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究LLM与SAT/SMT求解器混合推理中,将求解器输出转化为用户答案的叙述步骤存在的安全漏洞,通过形式化建模和实验评估发现证书门控可保证求解结果正确,但对抗攻击可反转结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20531 2026-06-19 cs.LO cs.LG 版本更新 57%

Pseudo-Formalization for Automatic Proof Verification

伪形式化用于自动证明验证

Slim Barkallah, Luke Bailey, Kaiyue Wen, Mohammed Abouzaid, Tengyu Ma

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种名为伪形式化的证明格式,该格式在保持自然语言灵活性的同时,保留了形式证明的模块性和精确性,通过块验证算法实现了对自然语言证明的高效验证,其在错误发现的精度和召回率上优于现有基线方法。

Comments 31 pages, code available at https://github.com/Slim205/pseudo-formalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18746 2026-06-18 cs.AI 新提交 57%

What Must Generalist Agents Remember?

通用型智能体必须记住什么?

Khurram Yamin, Namrata Deka, Maitreyi Swaroop, Albert Ting, Jeff Schneider, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文形式化论证了通用型智能体为在多个环境和目标下近似最优行动,必须存储领域相关信息以区分观察瓶颈处的不兼容最优动作,并证明记忆可用于重构局部转移动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09822 2026-06-18 cs.CE cs.AI 57%

Superstudent intelligence in thermodynamics

热力学中的超级学生智能

Rebecca Loubet, Pascal Zittlau, Marco Hoffmann, Luisa Vollmer, Sophie Fellenz, Heike Leitte, Fabian Jirasek, Johannes Lenhard, Hans Hasse

机构 * Laboratory of Engineering Thermodynamics (LTD)(工程热力学实验室) Visual Information Analysis Research Group (VIA)(视觉信息分析研究组) Machine Learning Research Group (ML)(机器学习研究组)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究展示OpenAI的o3模型在热力学考试中超越所有学生,证明机器在复杂任务中的能力,影响工程教育与实践。

Comments This document is the unedited Author's version of a yet to be Submitted Work to Physical Review Physics Education Research. 15 pages, 2 figures, Graphical Abstract, Highlights and SI available (12 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17073 2026-06-17 cs.RO cs.AI 新提交 57%

Extracting Semantics: LLM-Guided Automatic Population of Robot Ontology from URDF

提取语义:从URDF自动构建机器人本体的LLM引导方法

Bastien Dussard, Guillaume Sarthou

机构 * LAAS-CNRS, Department of Robotics, Toulouse, France(法国图卢兹机器人系CNRS实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出利用大语言模型从URDF文件自动生成机器人语义本体,通过多数投票和语法验证确保与现有本体对齐,初步实验表明该方法能有效桥接低层描述与高层知识表示。

Journal ref 18th International Conference on Social Robotics (ICSR 2026), University of London, Jul 2026, Londres, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15258 2026-06-16 cs.AI 新提交 57%

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Mask-Proof: 一种基于LLM的数学证明自动数据整理流水线

Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Graduate College for Engineers, Beijing University of Posts and Telecommunications(北京邮电大学研究生院工程师学院) School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出Mask-Proof流水线,将真实证明转化为可自动检查的掩码步骤任务,通过LLM等价性判断器评估模型推理,构建包含292个问题的基准,推理增强模型性能提升12%-27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15096 2026-06-16 cs.AI 新提交 57%

VGPT-RSI for RH-Adjacent Formal Progress: Boundary Certificates, Verified Finite Lagarias Inequalities, and Explicit Failure Localization

VGPT-RSI 用于 RH 邻近形式化进展:边界证书、已验证的有限 Lagarias 不等式和显式故障定位

Zhixin Hu, Tao Xu, Xiaodian Sun, Li Jin, Momiao Xiong

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出 VGPT-RSI 系统,通过构造并验证有限 RH 边界证书和 Lagarias 准则的有限形式化,实现 Riemann 假设邻近问题的部分形式化进展,并明确识别剩余数学障碍。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15078 2026-06-16 cs.AI cs.GT physics.soc-ph 新提交 57%

Cognitive Debt: AI as Intellectual Leverage and the Dynamics of Systemic Fragility

认知债务:作为智力杠杆的AI与系统性脆弱性的动态机制

Shuchen Meng

机构 * New York University(纽约大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出认知债务的形式化理论,通过建立包含认知资本和认知债务的状态变量模型,证明理性代理人会积累认知债务,并导致认知明斯基时刻和系统性脆弱性。

Comments 46 pages, 3 figures. Preliminary version; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12291 2026-06-16 cs.CL 新提交 57%

Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

测量大语言模型在误导性医疗上下文下的认知韧性

Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin, Alexandra M. Cardoso Pinto, Rachel Niesen, Laura Sophie Wegner, Dhruv Darji, Jung Moses Koo, Joshua Fieggen, Kapil Narain, Mingde Zeng, Lei Clifton, Linda Shapiro, Fenglin Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University of Washington(华盛顿大学) University College London(伦敦大学学院) University of Waterloo(滑铁卢大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出MedMisBench基准,通过注入误导性上下文测试大语言模型在医疗场景中的认知韧性,发现模型准确率从71.1%降至38.0%,权威性虚假信息攻击成功率达69.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13392 2026-06-15 cs.AI 新提交 57%

MiniMax Sparse Attention

MiniMax 稀疏注意力

Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Jinkai Hu, Jiayao Li, Rui Gao, Zekun Li, Songquan Zhu, Jingkai Zhou, Pengyu Zhao

机构 * MiniMax Peking University(北京大学) NVIDIA(英伟达) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13282 2026-06-12 cs.AI 新提交 57%

ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space

ERTS: 通过有界后果空间中的语义扰动进行伦理AI的对抗鲁棒性测试

Pratyush Chaudhari

机构 * Pratyush Chaudhari(普拉蒂什·查德哈里)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出伦理鲁棒性测试系统(ERTS),通过有界伦理后果空间、语义扰动和领域自适应评估,测试AI在伦理推理中的对抗鲁棒性,实验表明仅33%模型通过测试。

Comments 8 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12594 2026-06-12 cs.AI 新提交 57%

Pythagoras-Prover: Advancing Efficient Formal Proving via Augmented Lean Formalisation

Pythagoras-Prover: 通过增强型Lean形式化推进高效形式化证明

Joshua Ong Jun Leang, Zheng Zhao, Mihaela Cătălina Stoian, Qiyuan Xu, Haonan Li, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

机构 * Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出Pythagoras-Prover系列,包括自回归和扩散模型,通过课程SFT、动态过滤和增强型Lean形式化(ALF)扩展验证数据,在MiniF2F-Test上以更少参数超越DeepSeek-Prover-V2。

Comments Pythagoras-Prover: Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27628 2026-06-12 cs.AI cs.CY cs.ET cs.MA cs.SY eess.SY 版本更新 57%

Intelligence as Managed Autonomy: Failure, Escalation, and Governance for Agentic AI Systems

智能作为受管自主:代理型AI系统的失败、升级与治理

Srini Ramaswamy

机构 * DNRS.ai USA(DNRS.ai美国公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SMARt模型,通过形式化能力检测认知漂移、暂停推理、尝试恢复并在可靠性下降时放弃控制,以解决自主AI系统中的幻觉和持续不合理行为问题。

Comments This peer-reviewed paper is to appear in the Journal of Intelligent and Robotic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 57%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08256 2026-06-09 cs.AI cs.DL 新提交 57%

Traxia: A Framework for Verifiable, Agent-Native Scientific Publishing

Traxia:一个可验证的、智能体原生的科学出版框架

Wisdom Dogah

机构 * Faculty of Computing and Mathematical Sciences, University of Mines and Technology (UMaT), Tarkwa, Ghana(加纳塔夸矿业与技术大学计算与数学科学学院) BlackMatrix AI Research, Accra, Ghana(加纳阿克拉BlackMatrix AI研究院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出Traxia框架,通过智能体身份、可验证出版、四层同行评审、声誉机制和知识图谱,解决科学出版中可验证性、归属和可重复性问题。

Comments 22 pages, 3 figures, 3 tables. Preprint. Under active development. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22763 2026-06-09 cs.AI 版本更新 57%

Advancing Mathematics Research with AI-Driven Formal Proof Search

用AI驱动的形式证明搜索推进数学研究

George Tsoukalas, Anton Kovsharov, Sergey Shirobokov, Anja Surina, Moritz Firsching, Gergely Bérczi, Francisco J. R. Ruiz, Arun Suggala, Adam Zsolt Wagner, Eric Wieser, Lei Yu, Aja Huang, Miklós Z. Horváth, Andrew Ferraiuolo, Henryk Michalewski, Edward Lockhart, Codrut Grosu, Thomas Hubert, Matej Balog, Pushmeet Kohli, Swarat Chaudhuri

机构 * Google DeepMind(谷歌DeepMind) Aarhus University(奥胡斯大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了如何利用大型语言模型生成形式证明,以解决开放性数学问题,并展示了AI辅助形式证明搜索在数学研究中的应用和贡献。

Comments The first three authors and the last author have equal contributions. The first three authors are in random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11874 2026-06-09 cs.GT cs.AI cs.DS cs.LO cs.PL 版本更新 57%

Discovering Expert-Level Nash Equilibrium Algorithms with Large Language Models

利用大型语言模型发现专家级纳什均衡算法

Hanyu Li, Dongchen Li, Xiaotie Deng

机构 * CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学,北京,中国) School of Computing and Data Science, The University of Hong Kong, Pokfulam, Hong Kong(计算与数据科学学院,香港大学,薄扶林,香港)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出LegoNE框架,将专家证明策略编码为符号语言,自动验证算法的最坏情况保证,结合推理型LLM重新发现并改进了多人博弈的近似纳什均衡算法。

Comments accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07113 2026-06-08 cs.AI 新提交 57%

Beyond Post-hoc Explanation: Toward Glassbox AI via Probabilistic Mediation

超越事后解释:通过概率中介迈向玻璃箱AI

Manuele Leonelli

机构 * Manuele Leonelli(曼努埃尔·莱奥内利)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型在关键领域的不透明性,提出玻璃箱框架,利用贝叶斯网络作为事前中介层,实现可审计推理、不确定性量化和可争议输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06531 2026-06-08 cs.AI quant-ph 新提交 57%

CARVE-Q: Quantum-Proposed, Classically Certified Interactive Driving Repair

CARVE-Q:量子提议、经典认证的交互式驾驶修复

Yifan Wang

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 针对被否决的驾驶操作,提出CARVE-Q架构,通过量子最小搜索加速修复格搜索,同时保持安全认证的经典性,实现可审计的交互修复。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17948 2026-06-08 cs.CR cs.AI cs.MA 版本更新 57%

RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs

RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络

Parteek Jamwal, Minghao Shao, Boyuan Chen, Achyuta Muthuvelan, Asini Subanya, Boubacar Ballo, Kashish Satija, Mariam Shafey, Mohamed Mahmoud, Moncif Dahaji Bouffi, Pasindu Wickramasinghe, Siyona Goel, Yaakulya Sabbani, Hakim Hacid, Mthandazo Ndhlovu, Eleanna Kafeza, Sanjay Rawat, Muhammad Shafique

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23809 2026-06-05 eess.SY cs.LG cs.SY 57%

Advanced AI Service Provisioning in O-RAN through LLM Engine Integration

通过LLM引擎集成在O-RAN中的高级AI服务提供

Seyed Bagher Hashemi Natanzi, Pranshav Gajjar, Bo Tang, Vijay K. Shah

机构 * Department of Electrical and Computer Engineering, Worcester Polytechnic Institute(电气与计算机工程系,沃斯特理工学院) Department of Electrical and Computer Engineering, North Carolina State University(电气与计算机工程系,北卡罗来纳州立大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 提出一种双脑架构,结合LLM的推理能力和轻量级ML引擎的实时性,实现O-RAN中AI服务的自动化部署与配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04450 2026-06-04 cs.CL cs.CY 57%

Listening to the Workforce: Measuring Construction Worker Safety Attitudes from Social Media Discourse Using LLMs

倾听劳动力:使用LLMs从社交媒体话语中测量建筑工人安全态度

Farouq Sammour, Yuxin Zhang, Zhenyu Zhang

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 提出并验证了建筑安全态度框架(CSAF),通过LLM分类器从Reddit社区话语中测量工人安全态度,实现高精度多维分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03303 2026-06-04 cs.AI 57%

LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks

LEAP:利用智能体框架增强形式化数学的大语言模型

Po-Nien Kung, Linfeng Song, Dawsen Hwang, Jinsung Yoon, Chun-Liang Li, Simone Severini, Mirek Olšák, Edward Lockhart, Quoc V Le, Burak Gokturk, Thang Luong, Tomas Pfister, Nanyun Peng

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出LEAP智能体框架,通过分解问题、与Lean编译器交互及自我优化,使通用大模型在形式化定理证明上达到最先进性能,并在Putnam竞赛和Lean-IMO-Bench上超越专业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏