arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2512.14102 2025-12-17 cs.CV cs.AI cs.IR 57%

Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries

面向遥感文本到图像检索的神经符号推理:为复杂查询的基座模型

Emanuele Mezzi, Gertjan Burghouts, Maarten Kruithof

机构 * Vrije Universiteit Amsterdam(瓦赫宁根大学阿姆斯特丹) TNO(荷兰国防研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 RUNE通过结合大型语言模型和神经符号AI,利用逻辑推理提升遥感文本到图像检索的性能与可解释性,针对复杂查询和图像不确定性提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13752 2025-12-17 cs.CV cs.AI 57%

STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning

STAR:用于统一多模态学习的堆叠自回归方案

Jie Qin, Jiancheng Huang, Limeng Qiao, Lin Ma

机构 * Meituan Inc(美团公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23188 2025-12-16 cs.CL 57%

Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts

诊断、定位、对齐:一种用于在指令冲突下可靠LLM多智能体系统的全栈框架

Guancheng Wan, Leixin Sun, Longxu Dou, Zitong Shi, Fang Wu, Eric Hanchen Jiang, Wenke Huang, Guibin Zhang, Hejia Geng, Xiangru Tang, Zhenfei Yin, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sea AI Lab(Sea AI 实验室) Stanford University(斯坦福大学) University of Oxford(牛津大学) Yale University(耶鲁大学) NTU(南洋理工大学) NUS(新加坡国立大学) Boston University(波士顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种全栈框架,通过诊断、定位和对齐三个阶段提升LLM多智能体系统在指令冲突下的可靠性。

Comments Upon further review, we realized that the version submitted to arXiv was not the final draft and omits crucial results and discussion. To avoid confusion and ensure the integrity of the record, we request withdrawal and will resubmit once the complete work is ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14029 2025-12-16 cs.CL 57%

Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR

超越Pass@1:基于变分问题合成的自我博弈维持RLVR

Xiao Liang, Zhongzhi Li, Yeyun Gong, Yelong Shen, Ying Nian Wu, Zhijiang Guo, Weizhu Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于变分问题合成的自我博弈策略,有效维持RLVR训练中的策略熵,显著提升Pass@k性能,在多个基准测试中取得绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11402 2025-12-15 cs.SE cs.AI 57%

REMODEL-LLM: Transforming C code to Java using LLMs

REMODEL-LLM:利用LLMs将C代码转换为Java代码

Aryan Gupta, Y. Raghu Reddy

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 REMODEL-LLM研究利用LLMs将C代码转换为Java代码,发现大多数模型无法生成基本代码,仅少数模型通过部分测试,揭示了量化模型在复杂转换任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11067 2025-12-15 cs.DB cs.AI 57%

KathDB: Explainable Multimodal Database Management System with Human-AI Collaboration

KathDB:具有人机协作的可解释多模数据库管理系统

Guorui Xiao, Enhao Zhang, Nicole Sullivan, Will Hansen, Magdalena Balazinska

机构 * University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 KathDB是一种结合关系语义和基础模型推理能力的多模数据库管理系统,通过人机协作实现查询解析、执行和结果解释的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19286 2025-12-12 cs.CL 57%

TheMCPCompany: Creating General-purpose Agents with Task-specific Tools

TheMCPCompany:创建通用代理的专用工具

Reza Esfandiarpoor, Vishwas Suryanarayanan, Stephen H. Bach, Vishal Chowdhary, Anthony Aue

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 TheMCPCompany通过评估工具调用代理在现实世界服务交互中的表现,揭示了当前模型在复杂任务中的挑战。

Comments Code: https://github.com/Reza-esfandiarpoor/the-mcp-company

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16989 2025-12-12 cs.LG 57%

Unveiling the Latent Directions of Reflection in Large Language Models

揭示大型语言模型中反思的潜在方向

Fu-Chieh Chang, Yu-Ting Lee, Pei-Yuan Wu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文通过分析模型激活中的潜在方向,揭示了大型语言模型中反思机制的可控性及不同反思层次的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08944 2025-12-11 cs.CL 57%

Enhancing Reliability across Short and Long-Form QA via Reinforcement Learning

通过强化学习提升短篇和长篇问答的可靠性

Yudong Wang, Zhe Yang, Wenhan Ma, Zhifang Sui, Liang Zhao

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过强化学习框架减少短篇和长篇问答中的幻觉问题,提升模型可靠性与事实可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08939 2025-12-11 cs.HC cs.AI cs.CY 57%

Assessing the Human-Likeness of LLM-Driven Digital Twins in Simulating Health Care System Trust

评估由大语言模型驱动的数字双胞胎在模拟医疗系统信任方面的类人程度

Yuzhou Wu, Mingyang Wu, Di Liu, Rong Yin, Kang Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究评估了由大语言模型驱动的数字双胞胎在模拟医疗系统信任方面的类人程度,发现其在主要人口统计学模式上表现良好,但对教育水平等细微差异的捕捉能力有限。

Comments 6 pages, 1 figure may be published in IISE Annual Conference & Expo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06301 2025-12-10 cs.AI 57%

Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review

大语言模型及其在道路安全与出行提升中的应用:全面综述

Muhammad Monjurul Karim, Yan Shi, Shucheng Zhang, Bingzhang Wang, Mehrdad Nasri, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(土木与环境工程系,华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了大语言模型在道路安全与出行提升中的应用,探讨其在交通领域的适应策略及面临的挑战。

Journal ref Artificial Intelligence for Transportation, 1, 100004, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14683 2025-12-09 cs.SE cs.AI 57%

Unified Software Engineering Agent as AI Software Engineer

统一软件工程代理作为AI软件工程师

Leonhard Applis, Yuntong Zhang, Shanchao Liang, Nan Jiang, Lin Tan, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出统一软件工程代理USEagent,旨在通过协调多种能力提升软件开发效率,通过USEbench验证其效果,发现其在复杂任务中表现优于现有代理。

Comments Leonhard Applis and Yuntong Zhang contributed equally to this work. To appear in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06555 2025-12-09 cs.CR cs.AI cs.CY 57%

BEACON: A Unified Behavioral-Tactical Framework for Explainable Cybercrime Analysis with Large Language Models

BEACON:一种结合大语言模型的可解释性网络犯罪分析统一行为-战术框架

Arush Sachdeva, Rajendraprasad Saravanan, Gargi Sarkar, Kavita Vemuri, Sandeep Kumar Shukla

机构 * International Institute of Information Technology Hyderabad(国际信息研究所海得拉巴)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 BEACON通过整合行为心理学与网络犯罪战术生命周期,利用大语言模型实现网络犯罪的可解释性分析,提升分类准确率和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23730 2025-12-09 cs.CL 57%

Evaluating Long-Term Memory for Long-Context Question Answering

评估长期记忆以实现长上下文问答

Alessandra Terranova, Björn Ross, Alexandra Birch

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了增强记忆方法在长上下文问答任务中的效果,发现通过RAG和事件记忆可显著减少令牌使用并保持准确性。

Comments Accepted as a poster at Metacognition in Generative AI EurIPS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16001 2025-12-09 cs.AI q-bio.NC 57%

Artificial Human Intelligence: The role of Humans in the Development of Next Generation AI

人工人类智能:人类在下一代AI发展中的作用

Suayb S. Arslan

机构 * Department of Computer Engineering, Boğaziçi University(计算机工程系,博兹达奇大学) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology (MIT)(脑与认知科学系,麻省理工学院(MIT))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了人类在下一代AI发展中的关键作用,分析了人类与人工智能的互动,提出以人类为中心的发展方向,并强调伦理、责任和稳健智能系统的重要性。

Comments 19 pages, 8 figures, 2 tables, accepted to IEEE Transactions on Emerging Topics in Computational Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09058 2025-12-05 cs.SE cs.AI cs.SY eess.SY 57%

EmbedGenius: Towards Automated Software Development for Generic Embedded IoT Systems

EmbedGenius: 面向通用嵌入式物联网系统的自动化软件开发

Huanqi Yang, Mingzhe Li, Mingda Han, Zhenjiang Li, Weitao Xu

机构 * City University of Hong Kong(香港城市大学) Shandong University(山东大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 EmbedGenius通过结合大语言模型和嵌入式系统知识,实现了通用嵌入式物联网系统的自动化软件开发,显著提升了代码生成准确率和任务完成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03080 2025-12-04 physics.chem-ph cs.AI cs.CE 57%

AtomDisc: An Atom-level Tokenizer that Boosts Molecular LLMs and Reveals Structure--Property Associations

AtomDisc: 一种提升分子大语言模型并揭示结构-性质关联的原子级分词器

Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能动力部,香港科学与技术大学(广州)) The College of Computer Science and Technology, The Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 AtomDisc通过原子级分词提升分子LLM性能,揭示结构-性质关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01775 2025-12-02 cs.LG 57%

How Does RL Post-training Induce Skill Composition? A Case Study on Countdown

强化学习后训练如何诱导技能组合?一个倒计时案例研究

Simon Park, Simran Kaur, Sanjeev Arora

机构 * Princeton Language and Intelligence (PLI), Princeton University(普林斯顿语言与智能研究所(PLI)、普林斯顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本研究通过倒计时任务分析强化学习后训练如何诱导技能组合,揭示了模型在不同树结构上的学习顺序和泛化能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10695 2025-12-02 cs.CL 57%

"As Eastern Powers, I will veto." : An Investigation of Nation-level Bias of Large Language Models in International Relations

作为东方国家,我将 veto。:对大型语言模型在国际关系领域国家层面偏见的调查

Jonghyeon Choi, Yeonjun Choi, Hyun-chul Kim, Beakcheol Jang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在国际关系领域中的国家层面偏见,提出了一种去偏框架以减少偏见并提升性能。

Comments 21 pages, 4 figures. This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22955 2025-12-01 cs.LG 57%

Experts are all you need: A Composable Framework for Large Language Model Inference

专家足矣:一种用于大语言模型推理的可组合框架

Shrihari Sridharan, Sourjya Roy, Anand Raghunathan, Kaushik Roy

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 Comp-LLM通过可组合的推理框架实现跨专家协作,提升大语言模型的准确性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02789 2025-12-01 cs.CL 57%

Strong Memory, Weak Control: An Empirical Study of Executive Functioning in LLMs

强记忆,弱控制:对大语言模型执行功能的实证研究

Karin de Langis, Jong Inn Park, Bin Hu, Khanh Chi Le, Andreas Schramm, Michael C. Mensink, Andrew Elfenbein, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Department of Linguistics, Hamline University(语言学系,哈姆林大学) Department of Psychology, University of Wisconsin-Stout(心理学系,威斯尼斯托大学) Department of English, University of Minnesota(英语系,明尼苏达大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大语言模型在工作记忆方面表现优异,但执行功能和问题解决能力存在不足,提示需进一步改进注意力控制和认知灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20662 2025-11-27 cs.CL 57%

Democratizing LLM Efficiency: From Hyperscale Optimizations to Universal Deployability

让大语言模型效率普及:从超大规模优化到通用部署

Hen-Hsen Huang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通过改进LLM的效率方法,使其在有限资源和专业知识下仍能有效运作,以实现更广泛的部署和公平性。

Comments 8 pages, accepted as a Blue Sky Talk in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21250 2025-11-27 cs.CL 57%

ReSCORE: Label-free Iterative Retriever Training for Multi-hop Question Answering with Relevance-Consistency Supervision

ReSCORE:无标签迭代检索器训练用于多跳问答的 relevancy-一致性监督

Dosung Lee, Wonjun Oh, Boyoung Kim, Minyoung Kim, Joonsuk Park, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NAVER AI Lab(NAVER AI实验室) NAVER Cloud(NAVER云) University of Richmond(里奇蒙大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ReSCORE通过无标签数据训练密集检索器,提升多跳问答的检索与回答性能。

Comments 9 pages, 3 figures, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20109 2025-11-26 cs.LG 57%

CLIMATEAGENT: Multi-Agent Orchestration for Complex Climate Data Science Workflows

CLIMATEAGENT: 多智能体编排用于复杂气候数据科学工作流

Hyeonjae Kim, Chenyue Li, Wen Deng, Mengxi Jin, Wen Huang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.LG

AI总结 ClimateAgent通过多智能体编排和动态API意识,实现端到端自动化气候数据分析,取得优于基线方法的高任务完成率和报告质量。

Comments 30 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20086 2025-11-26 cs.CL 57%

More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering

更多偏见,更少偏见:用于增强多项选择题回答的BiasPrompting

Duc Anh Vu, Thong Nguyen, Cong-Duy Nguyen, Viet Anh Nguyen, Anh Tuan Luu

机构 * Nanyang Techonological University(南洋理工大学) National University of Singapore(国立新加坡大学) Centre for AI research, VinUniversity(Vin大学人工智能研究中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 BiasPrompting通过引导LLMs生成并评估所有可能答案的推理过程,提升多项选择题回答的推理能力,尤其在复杂问题中表现优异。

Comments Accepted at the 41st ACM/SIGAPP Symposium On Applied Computing (SAC 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19483 2025-11-26 cs.SE cs.AI 57%

Z-Space: A Multi-Agent Tool Orchestration Framework for Enterprise-Grade LLM Automation

Z-Space:面向企业级LLM自动化的一种多智能体工具协调框架

Qingsong He, Jing Nan, Jiayu Jiao, Liangjie Tang, Xiaodong Xu, Mengmeng Sun, Qingyao Wang, Minghui Yan

机构 * Rajax Network Technology (ele.me)(Rajax网络技术(ele.me))

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 Z-Space通过多智能体协作框架提升企业级LLM自动化工具调用效率与准确性

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM 57%

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23715 2025-11-25 cs.CL 57%

Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models

不要轻信前提:评估大语言模型的前提批判能力

Jinzhe Li, Gengxu Li, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出前提批判基准,评估大语言模型在面对错误前提时的批判能力,揭示其在推理与前提批判上的差异及改进需求。

Comments EMNLP 2025 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17927 2025-11-25 cs.CV cs.AI 57%

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

PA-FAS: 向可解释和通用的多模态人脸反伪装迈进:通过路径增强强化学习

Yingjie Ma, Xun Lin, Yong Xu, Weicheng Xie, Zitong Yu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 PA-FAS通过路径增强强化学习提升多模态人脸反伪装的可解释性和泛化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17198 2025-11-24 cs.AI cs.CV 57%

Designing Domain-Specific Agents via Hierarchical Task Abstraction Mechanism

通过层次化任务抽象机制设计领域专用代理

Kaiyu Li, Jiayu Wang, Zhi Wang, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分公司)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 本文提出层次化任务抽象机制,设计领域专用代理EarthAgent,通过任务结构对齐提升复杂地理空间分析的规划能力。

Comments Page: https://earth-insights.github.io/EarthAgent

详情

展开后加载摘要…

URL PDF HTML 收藏