arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-16 至 2025-12-16 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 6 篇

2506.02454 2025-12-16 cs.CL cs.AI 73%

Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework

多模态深度研究员:从零开始生成文本-图表交织报告的代理框架

Zhaorui Yang, Bo Pan, Han Wang, Yiyao Wang, Xingyu Liu, Luoxuan Weng, Yingchaojie Feng, Haozhe Feng, Minfeng Zhu, Bo Zhang, Wei Chen

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 多模态深度研究员通过代理框架实现从零开始生成文本-图表交织报告,利用FDV结构化文本表示提升可视化生成质量。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09810 2025-12-16 cs.AI 70%

Towards a Common Framework for Autoformalization

迈向自动形式化的一个共同框架

Agnieszka Mensfelt, David Tena Cucala, Santiago Franco, Angeliki Koutsoukou-Argyraki, Vince Trencsenyi, Kostas Stathis

机构 * Department of Computer Science, Royal Holloway, University of London(伦敦大学皇家霍洛威学院计算机科学系) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文旨在提出一个统一框架,以促进不同领域之间的交叉融合,推动下一代人工智能系统的发展。

Comments Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575). A shorter version of this work will appear in the Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07927 2025-12-16 cs.AI cs.CL cs.LG 67%

Solving Inequality Proofs with Large Language Models

用大语言模型解决不等式证明

Pan Lu, Jiayi Sheng, Luna Lyu, Jikai Jin, Tony Xia, Alex Gu, James Zou

机构 * Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种非正式但可验证的任务公式化方法,通过IneqMath数据集和LLM-as-judge评估框架,揭示了大语言模型在解决不等式证明任务中的局限性及改进方向。

Comments 50 pages, 24 figures, accepted as a Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17904 2025-12-16 cs.CR cs.AI cs.CL 62%

BreakFun: Jailbreaking LLMs via Schema Exploitation

BreakFun: 通过模式利用对LLM进行劫持

Amirkia Rafiei Oskooei, Mehmet S. Aktas

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 BreakFun通过利用LLM对结构模式的遵守能力,揭示了其在劫持攻击中的脆弱性,并提出对抗性提示解构作为缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12923 2025-12-16 cs.AI cs.MA 57%

The Traitors: Deception and Trust in Multi-Agent Language Model Simulations

背叛者:多智能体语言模型模拟中的欺骗与信任

Pedro M. P. Curvo

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 The Traitors通过多智能体模拟研究LLM在社交互动中的欺骗与信任问题,揭示先进模型在欺骗能力与检测能力上的不对称性。

Comments 9 main pages, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21329 2025-12-16 cs.AI physics.soc-ph 57%

Active Inference AI Systems for Scientific Discovery

主动推断AI系统用于科学发现

Karthik Duraisamy

机构 * Michigan Institute for Computational Discovery & Engineering(密歇根计算发现与工程研究所) University of Michigan(密歇根大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出主动推断AI系统,通过结合缓慢假设生成与快速验证推理,利用因果和多模态模型促进科学发现,强调人类判断在处理不确定性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏