arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 290 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 290 篇

2606.17803 2026-06-17 cs.LG 新提交 57%

Continual Self-Improvement with Lightweight Experiential Latent Memories

持续自我改进:轻量级经验潜在记忆

Vaggelis Dorovatas, Nancy Kalaj, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田汽车欧洲公司) University of Trento(特伦托大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一种在线方法,将推理时计算转化为轻量级模块化潜在记忆,通过自生成测试时信号进行训练,实现持续改进且避免灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17657 2026-06-17 cs.AI 新提交 57%

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games

使用认知模型改进语言模型对人类说服博弈的模拟

Zirui Cheng, Zeyu Shen, Thomas L. Griffiths, Peter Henderson

机构 * Princeton University(普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出方程到行为提示和强化学习方法,使语言模型匹配认知模型(如贝叶斯更新、动机推理),在说服博弈中提升模拟人类决策多样性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16111 2026-06-16 cs.CL 新提交 57%

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

面向帕累托最优工具集成智能体的帕累托排名策略优化

Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。

Comments ICML 2026 Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15577 2026-06-16 cs.AI 新提交 57%

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

大型语言模型作为优化器:直接方法与工具增强方法的调查及其性能前沿

Roko Peran, Luka Hobor, Mihael Kovac, Mario Brcic

机构 * University of Zagreb, Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 综述LLM作为优化器的三种范式(直接优化、工具增强优化、工具创造优化),分析性能前沿与推理差距,探讨直接优化的未来潜力与工具增强优化的可审计性之间的权衡。

Comments 6 pages, 1 figure, 2 tables, accepted at 49th ICT and Electronics Convention, MIPRO - https://mipro.hr; Paper ID: #23463

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13782 2026-06-16 cs.AI 新提交 57%

MA-ProofBench: A Two-Tiered Evaluation of LLMs for Theorem Proving in Mathematical Analysis

MA-ProofBench: 数学分析中定理证明的大语言模型双层评估基准

Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hongya Lyu, Xin Li, Jie Zhou, Yudong Wang

机构 * ModelBest Inc. Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出首个面向数学分析的形式化定理证明基准MA-ProofBench,包含200个定理,覆盖6个核心主题和27个子类别,分为本科和博士资格两级难度,评估发现当前模型表现不佳,GPT-5.5在Level I上仅达16% Pass@8。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14620 2026-06-15 cs.LG 新提交 57%

Neither Parallel Nor Sequential: How DiffusionGemma Actually Commits Tokens

既非并行也非顺序:DiffusionGemma 实际如何提交令牌

Ali Asaria, Tony Salomone, Deep Gandhi

机构 * Transformer Lab

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 通过钩取DiffusionGemma 26B的采样器接受步骤,测量其解码顺序,发现解码既非并行也非块自回归,而是呈现部分从左到右的提交偏差,且块大小是测量尺度的伪影而非架构特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12935 2026-06-12 cs.AI 新提交 57%

MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

MARS: 用于并行LLM测试时扩展的边际对抗风险控制停止策略

Wenbo Chen, Puheng Li, Mengyang Liu, Weijie Su, Tianpei Xie

机构 * Amazon(亚马逊) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MARS停止规则,通过监测中间检查点的聚合投票并利用对抗性边界估计未来投票变化,在保证准确率的同时节省25-47%的自一致性token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12273 2026-06-11 cs.CL 新提交 57%

Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models

超越完全随机掩码:扩散语言模型的注意力引导去噪与优化

Jia Deng, Junyi Li, Wayne Xin Zhao, Jinpeng Wang, Hongyu Lu, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Meituan(美团) WeChat, Tencent(腾讯微信) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(大型模型与智能治理北京市重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出AGDO框架,利用注意力结构指导去噪顺序并强化关键令牌,在数学和编码基准上提升扩散语言模型的推理性能。

Comments 13 pages. Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11512 2026-06-11 cs.CL 新提交 57%

SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment

SAGE: 面向言语不确定性对齐的答案条件不确定性目标

Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出SAGE目标,通过答案条件不确定性几何从模型采样响应中构建群组级不确定性目标,结合GUPO训练框架优化言语不确定性表达,在多项推理任务中提升不确定性排序、降低校准误差和过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10799 2026-06-10 cs.AI 新提交 57%

Evaluating Research-Level Math Proofs via Strict Step-Level Verification

通过严格的步骤级验证评估研究级数学证明

Yifeng Sun

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出严格步骤级验证框架,通过约束推理上下文和定理来源,解决大模型在复杂数学证明验证中的“上下文中毒”问题,在FirstProof挑战数据集上优于全局评估,并揭示基准中的隐含歧义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交 57%

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08411 2026-06-09 cs.CL 新提交 57%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06902 2026-06-08 cs.LG 新提交 57%

TALAN: Task-Aligned Latent Adaptation Networks for Targeted Post-Training of Large Language Models

TALAN:面向大型语言模型目标后训练的任务对齐潜在自适应网络

Chengkai Zhang, Ziteng Liu, Junpu Wang, Zeyi Tao, Yang Wang, Sagar Chordia, Qin Huang

机构 * Meta AI

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出TALAN,一种序列条件潜在旁路,插入Transformer残差流并与低秩适配器协同训练,在STEM/代码基准上平均提升LoRA 1.41点、DoRA 1.85点,仅增加<1%可训练参数和1.01-1.02倍推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07825 2026-08-11 cs.CY cs.HC 新提交 50%

AI as a Democratizing Force in Indie Game Development

AI作为独立游戏开发中的民主化力量

Brian Madanamootoo, Jatin Alla

专题命中 数学推理 :planning(abstract)

AI总结 该研究考察AI对2024-2026年游戏行业分化的影响,发现AI大幅降低独立游戏制作的协调成本,推动第三波民主化浪潮,披露AI的游戏接受度与传统游戏相当,但市场已呈现结构性过剩的前提条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 50%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06377 2026-07-08 math.HO 新提交 50%

Automation Without Understanding

没有理解的自动化

Jun-Yong Park

专题命中 数学推理 :reasoning(abstract)

AI总结 探讨人工智能产出数学成果但美国削弱相关人才培养渠道这一现象,主张将数学能力视为战略资产,提出要求进行重要推理的人工智能系统以可检查形式公开关键主张,以避免战略错误。

Comments 10 pages. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05226 2026-07-08 math.PR math.ST stat.ML stat.TH 新提交 50%

The Exact Worst-Case Tail Probability under Bounded Kurtosis

有界峰度下的精确最坏情况尾概率

Xiaoyu Li, Andi Han, Jiaojiao Jiang, Junbin Gao

专题命中 数学推理 :reasoning(abstract)

AI总结 研究有界峰度下单边尾控制问题,通过AI引导搜索确定最坏情况尾概率的四区域映射,给出各区域表达式及证明度相图,还得到精确最坏情况分位数等。

Comments v2: fixed cross-reference names rendered incorrectly by the arXiv TeX complier and made minor edits. Code, certificates, and the full instance tables are available at https://github.com/xiaoyulics/lemmaforge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00820 2026-07-02 cs.SE 新提交 50%

Knowledge-Enhanced Agentic Vulnerability Repair

知识增强的智能体漏洞修复

Sicong Cao, Hao Ma, Le Yu, Kangyi Ding, Xiaolei Liu, Terry Yue Zhuo, Bo Wang, Xingwei Lin, Xiaobing Sun, Linzhang Wang, David Lo

专题命中 数学推理 :reasoning(abstract)

AI总结 提出KeaRepair,一种基于智能体的自动化漏洞修复方法,通过提取历史漏洞知识并利用工具增强的智能体进行诊断,生成并迭代优化补丁,在55个C/C++漏洞上修复率达83.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27570 2026-06-29 cs.LO 新提交 50%

Auditing AI Investment Recommendations as Executable Actions

审计AI投资建议作为可执行行动

Sidnei Barbieri, Wellington Vargas, Ágney Lopes Roth Ferraz

专题命中 数学推理 :verifier(abstract)

AI总结 提出将AI投资建议作为可执行金融行动进行审计,通过确定性基线协议评估有效性、稳定性和一致性,发现一致性单独评估具有误导性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19826 2026-06-19 cs.CR cs.MA 新提交 50%

Heterogeneous LLM Debate Under Adversarial Peers: Honest Gains, Replacement Costs, and Resilience

对抗性同伴下的异构LLM辩论:诚实增益、替代成本与韧性

Prashanti Nilayam, Kiran Kumar Ramanna, Prashil Tumbade, Sankalp Nayak

专题命中 数学推理 :reasoning(abstract)

AI总结 研究异构LLM辩论中诚实与对抗性同伴对修正行为的影响,发现诚实同伴降低有害修正率,对抗性同伴则逆转,且异构性在已有对手时也能作为防御。

详情

展开后加载摘要…

URL PDF HTML 收藏