arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 313 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 57 篇

2511.13043 2025-12-02 cs.CL 77%

Spark-Prover-X1: Formal Theorem Proving Through Diverse Data Training

Spark-Prover-X1:通过多样化数据训练实现形式定理证明

Xinyuan Zhou, Yi Lei, Xiaoyu Zhou, Jingyi Sun, Yu Zhu, Zhongyi Ye, Weitai Zhang, Quan Liu, Si Wei, Cong Liu

机构 * iFlytek Research(iFlytek研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 Spark-Prover-X1通过多样化数据训练提升轻量级LLMs的形式推理能力,实现形式定理证明的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02203 2025-12-02 cs.AI 77%

GraphIC: A Graph-Based In-Context Example Retrieval Model for Multi-Step Reasoning

GraphIC: 一种基于图的上下文示例检索模型用于多步推理

Jiale Fu, Yaqing Wang, Simeng Han, Jiaming Fan, Xu Yang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GraphIC是一种基于图的上下文示例检索模型,通过推理意识的表示和专门相似性度量提升LLM在多步推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04341 2025-12-02 cs.AI 76%

Monitor-Generate-Verify (MGV): Formalising Metacognitive Theory for Language Model Reasoning

Monitor-Generate-Verify (MGV): 形式化语言模型推理的元认知理论

Nick Oh, Fernand Gobet

机构 * socius labs Centre for Philosophy of Natural and Social Science (CPNSS)(哲学自然与社会科学中心) London School of Economics(伦敦经济学院)

专题命中 推理与问题求解 :language model(title,comments);分类 cs.AI

AI总结 MGV框架通过引入监控机制,弥补生成-验证范式中监控过程的缺失,以提升语言模型推理的准确性和鲁棒性。

Comments Presented at the Workshop on the Foundations of Reasoning in Language Models at NeurIPS 2025 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01979 2025-12-02 cs.AI cs.CL cs.CV 73%

Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback

Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位

Aiden Yiliu Li, Bizhi Yu, Daoan Lei, Tianhe Ren, Shilong Liu

机构 * University College London(伦敦大学学院) Chico Future AI Lab(芝加哥未来人工智能实验室) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06108 2025-12-02 cs.LG cs.CL 73%

Influence Functions for Efficient Data Selection in Reasoning

用于推理中高效数据选择的影响函数

Prateek Humane, Paolo Cudrano, Daniel Z. Kaplan, Matteo Matteucci, Supriyo Chakraborty, Irina Rish

机构 * Mila, Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Politecnico di Milano(米兰理工学院) Sage Group(Sage集团) Capital One

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过影响函数定义推理数据质量,并引入基于影响的修剪方法,以提升数学推理性能。

Comments 4 pages, 2 figures; added link to codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17989 2025-12-02 cs.LG cs.AI 73%

Outcome-based Reinforcement Learning to Predict the Future

基于结果的强化学习用于预测未来

Benjamin Turtel, Danny Franklin, Kris Skotheim, Luke Hewitt, Philipp Schoenegger

机构 * Lightning Rod Labs Stanford University(斯坦福大学) London School of Economics and Political Science(伦敦政治经济学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于结果的强化学习方法,通过训练紧凑模型提升预测准确性并增强概率校准,实验证明其在预测市场中的实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00908 2025-12-02 cs.LG cs.AI 73%

Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs

超越高熵探索:面向推理LLM的正确性感知低熵段优势塑造

Xinzhu Chen, Xuesheng Li, Zhongxiang Sun, Weijie Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Artificial Intelligence and Data Science, University of International Business and Economics(国际经济贸易大学人工智能与数据科学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LESS通过正确性感知的低熵段优势调节,提升推理LLM的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00466 2025-12-02 cs.CL cs.AI 73%

SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling

SCALE:面向数学测试时间扩展中性能瓶颈的有选择性资源分配

Yang Xiao, Chunpu Xu, Ruifeng Yuan, Jiashuo Wang, Wenjie Li, Pengfei Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SCALE通过有选择性地分配计算资源,提升数学推理性能,显著优于均匀扩展方法。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17442 2025-12-02 cs.CL cs.AI 73%

Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring

Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能

Shiting Chen, Zijian Zhao, Jinsong Chen

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00016 2025-12-02 cs.AR cs.AI cs.LG 73%

Architect in the Loop Agentic Hardware Design and Verification

循环架构代理硬件设计与验证

Mubarek Mohammed

机构 * Western Washington University(西雅图华盛顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种带有工程师参与的代理自动化处理器设计与验证方法,通过生成HDL代码和测试平台,实现高效且经济的硬件设计实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01558 2025-12-02 cs.LG cs.CL 73%

Predicting the Performance of Black-box LLMs through Follow-up Queries

通过后续查询预测黑盒大语言模型的性能

Dylan Sam, Marc Finzi, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过后续查询预测黑盒大语言模型性能,利用响应概率训练可靠预测器,有效区分模型正确性及对抗性影响。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01223 2025-12-02 cs.CV cs.AI 70%

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00881 2025-12-02 cs.AI 70%

Hybrid-DMKG: A Hybrid Reasoning Framework over Dynamic Multimodal Knowledge Graphs for Multimodal Multihop QA with Knowledge Editing

Hybrid-DMKG: 一种基于动态多模态知识图谱的混合推理框架用于多模态多跳问答与知识编辑

Li Yuan, Qingfei Huang, Bingshan Zhu, Yi Cai, Qingbao Huang, Changmeng Zheng, Zikun Deng, Tao Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Hybrid-DMKG通过动态多模态知识图谱实现多跳问答中的准确推理,提升对知识更新的鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00789 2025-12-02 cs.CL 70%

Auxiliary-Hyperparameter-Free Sampling: Entropy Equilibrium for Text Generation

辅助超参数-free采样:信息论视角下的文本生成熵平衡

Xiaodong Cai, Hai Lin, Shaoxiong Zhan, Weiqi Luo, Hong-Gee Kim, Hongyan Hao, Yu Yang, Hai-Tao Zheng

机构 * Meituan(美团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出熵平衡采样方法,通过信息论原理实现无超参数调优的文本生成,提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00772 2025-12-02 cs.IR cs.AI cs.DL 70%

SHRAG: AFrameworkfor Combining Human-Inspired Search with RAG

SHRAG:一种结合人类启发式搜索与RAG的框架

Hyunseok Ryu, Wonjune Shin, Hyun Park

机构 * Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学) Joint Institute for Nuclear Research(联合核子研究中心) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学) Department of AI Convergence(人工智能融合部门) College of Information Computing(信息计算学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SHRAG结合人类启发式搜索与RAG,提升检索精度与生成可靠性,实现多语言高效问答。

Comments 10 pages, 4 figures, 1 table, 1 algorithm, 3 prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00683 2025-12-02 cs.AI 70%

Model of human cognition

认知模型

Wu Yonggang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种神经理论框架,旨在通过功能鲁棒性和生物合理性解释智能的产生,并为创建可解释和可推广的人工智能提供计算高效的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27044 2025-12-02 cs.LG 70%

Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning

RLVR在数学推理中的泛化极限:两个案例研究

Md Tanvirul Alam, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RLVR在数学推理任务中通过强化表面启发式方法提升指标,但难以获得真实推理策略,凸显其泛化能力的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00294 2025-12-02 cs.CV cs.AI cs.HC 70%

Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR

词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索

Lixing Guo, Tobias Höllerer

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22625 2025-12-02 cs.CV 67%

ReasonEdit: Towards Reasoning-Enhanced Image Editing Models

ReasonEdit: 向推理增强的图像编辑模型迈进

Fukun Yin, Shiyu Liu, Yucheng Han, Zhibo Wang, Peng Xing, Rui Wang, Wei Cheng, Yingming Wang, Aojie Li, Zixin Yin, Pengtao Chen, Xiangyu Zhang, Daxin Jiang, Xianfang Zeng, Gang Yu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ReasonEdit通过引入思考和反思机制,提升图像编辑模型的推理能力,实现更准确的编辑效果。

Comments code: https://github.com/stepfun-ai/Step1X-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13047 2025-12-02 cs.CV 67%

InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving

InsightDrive: 用于端到端自动驾驶的洞察场景表示

Ruiqi Song, Xianda Guo, Yanlun Peng, Qinggong Wei, Hangbin Wu, Long Chen

机构 * College of Surveying and Geo-informatics, Tongji University(同济大学测绘与地理信息学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Computer Science, Wuhan University(武汉大学计算机学院) The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Great Wall Motor(长城汽车) IAIR, Xi’an Jiaotong University(西安交通大学IAIR)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 InsightDrive通过结合显式和隐式场景表示,提升自动驾驶轨迹规划的鲁棒性和人类认知一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00494 2025-12-02 cs.LG cs.AI 62%

Exploring System 1 and 2 communication for latent reasoning in LLMs

探索用于大语言模型中潜在推理的系统1和系统2通信

Julian Coda-Forno, Zhuokai Zhao, Qiang Zhang, Dipesh Tamboli, Weiwei Li, Xiangjun Fan, Lizhu Zhang, Eric Schulz, Hsiao-Ping Tseng

机构 * Meta

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了大语言模型中潜在推理的双架构通信方法,发现联合微调比增加通道容量更有效,但需设计明确的目标和训练计划以提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00839 2025-12-02 cs.AI stat.CO stat.ME 57%

ARCADIA: Scalable Causal Discovery for Corporate Bankruptcy Analysis Using Agentic AI

ARCADIA:基于代理AI的可扩展因果发现方法用于企业破产分析

Fabrizio Maturo, Donato Riccio, Andrea Mazzitelli, Giuseppe Bifulco, Francesco Paolone, Iulia Brezeanu

机构 * Department of Economics, Statistics and Business, Universitas Mercatorum, Rome, Italy(经济学、统计学与商业系,墨菲大学,罗马,意大利) Department of Engineering and Science, Universitas Mercatorum, Rome, Italy(工程与科学系,墨菲大学,罗马,意大利) Independent Researcher, Bucharest, Romania(独立研究者,布加勒斯特,罗马尼亚)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 ARCADIA通过代理AI结合大语言模型和统计诊断,实现企业破产分析中的可扩展因果发现,提供可靠且可解释的因果图模型。

Comments 35 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00552 2025-12-02 cs.CL 57%

Catch Me If You Can: How Smaller Reasoning Models Pretend to Reason with Mathematical Fidelity

捉摸不到:为何小型推理模型用数学严谨性伪装推理

Subramanyam Sahoo, Vinija Jain, Saanidhya Vats, Siddharth Mohapatra, Rui Min, Aman Chadha, Divya Chaudhary

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 该研究提出诊断框架,揭示小型模型依赖模式匹配而非真实逻辑计算,通过四个轴线评估推理忠实性,推动可验证的数学推理研究。

Comments 8 pages, 5 figures. A preprint. Initial Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00344 2025-12-02 cs.AI 57%

Echo-N1: Affective RL Frontier

Echo-N1:情感强化学习前沿

Naifan Zhang, Ruihan Sun, Ruixi Su, Shiqi Ma, Shiya Zhang, Xianna Weng, Xiaofan Zhang, Yuhan Zhan, Yuyang Xu, Zhaohan Chen, Zhengyuan Pan, Ziyi Song

机构 * Echo-N1: Affective RL Frontier Team(情感强化学习前沿团队)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 Echo-N1通过实时推断用户个性并优化个性化对话偏好,开创了情感强化学习的新领域,显著提升了人类般的交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12003 2025-12-02 cs.AI 57%

Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning

看而思:通过强化学习统一推理与视觉证据归因以实现可验证文档RAG

Shuochen Liu, Pengfei Luo, Chao Zhang, Yuhao Chen, Haotian Zhang, Qi Liu, Xin Kou, Tong Xu, Enhong Chen

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 通过强化学习统一推理与视觉证据归因,提升多模态问答的可验证性和准确性。

Comments Poster of AAAI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00740 2025-12-02 cs.MA 50%

Augmented Runtime Collaboration for Self-Organizing Multi-Agent Systems: A Hybrid Bi-Criteria Routing Approach

增强型运行时协作用于自组织多智能体系统:一种混合双标准路由方法

Qingwen Yang, Feiyu Qu, Tiezheng Guo, Yanyi Liu, Yingyou Wen

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出BiRouter,一种混合双标准路由方法,用于自组织多智能体系统,通过平衡重要性和连续性指标提升任务路由性能和鲁棒性。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00582 2025-12-02 cs.CV 50%

SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension

SatireDecoder: 视觉级联解耦以增强讽刺图像理解

Yue Jiang, Haiwei Xue, Minghao Han, Mingcheng Li, Xiaolu Hou, Dingkang Yang, Lihua Zhang, Xu Zheng

专题命中 推理与问题求解 :language model(abstract)

AI总结 SatireDecoder通过视觉级联解耦和不确定性分析策略,提升讽刺图像理解的准确性和语义层次。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 82 篇

2507.19361 2025-12-02 cs.CL cs.AI cs.SC cs.SD eess.AS 90%

SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models

SpeechIQ: 大型语言模型在语音理解中的跨认知层级语音智能商

Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi

机构 * Kyoto University(京都大学) NVIDIA Carnegie Mellon University(卡内基梅隆大学) Institute of Science Tokyo(东京科学研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SpeechIQ是一种基于语音的智能评估框架,通过三个认知层级评估大型语言模型在语音理解中的能力,提供统一的比较和识别标注错误与幻觉。

Comments ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20073 2025-12-02 cs.CL cs.AI cs.MA 90%

Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents

Collab-Overcooked: 大语言模型作为协作代理的基准测试与评估

Haochen Sun, Shuwen Zhang, Lujie Niu, Lei Ren, Hao Xu, Hao Fu, Fangkun Zhao, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Collab-Overcooked基准测试,评估大语言模型在协作代理中的表现,揭示其在目标解释和协作能力上的优劣。

Comments Accepted to EMNLP 2025 Main Conference. Camera-Ready Version. 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00290 2025-12-02 cs.CL cs.AI 90%

EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education

EduEval: 一个用于评估大语言模型在中文教育中表现的分层认知基准

Guoqing Ma, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Jiawei Shen, Zilong Li, Yidan Liang

机构 * Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 EduEval通过分层认知基准评估大语言模型在中文教育中的表现,揭示其在事实性任务与创造性任务上的差异,并发现开源模型在复杂教育推理上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏