arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-15 至 2025-12-15 共收录 53 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2512.00679 2025-12-15 cs.IR 67%

ProEx: A Unified Framework Leveraging Large Language Model with Profile Extrapolation for Recommendation

ProEx:一种利用大语言模型与特征外推的统一框架用于推荐

Yi Zhang, Yiwen Zhang, Yu Wang, Tong Chen, Hongzhi Yin

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 ProEx通过多维度资料外推提升推荐系统性能,利用链式推理构建多样化的用户和物品资料,以增强推荐效果。

Comments Accepted by KDD 2026 (First Cycle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11402 2025-12-15 cs.SE cs.AI 57%

REMODEL-LLM: Transforming C code to Java using LLMs

REMODEL-LLM:利用LLMs将C代码转换为Java代码

Aryan Gupta, Y. Raghu Reddy

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 REMODEL-LLM研究利用LLMs将C代码转换为Java代码,发现大多数模型无法生成基本代码,仅少数模型通过部分测试,揭示了量化模型在复杂转换任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11067 2025-12-15 cs.DB cs.AI 57%

KathDB: Explainable Multimodal Database Management System with Human-AI Collaboration

KathDB:具有人机协作的可解释多模数据库管理系统

Guorui Xiao, Enhao Zhang, Nicole Sullivan, Will Hansen, Magdalena Balazinska

机构 * University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 KathDB是一种结合关系语义和基础模型推理能力的多模数据库管理系统,通过人机协作实现查询解析、执行和结果解释的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 12 篇

2506.21546 2025-12-15 cs.CV cs.AI cs.CL cs.LG 82%

Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination

反事实分割推理:诊断和缓解像素接地幻觉

Xinzhuo Li, Adheesh Juvekar, Jiaxun Zhang, Xingyou Liu, Muntasir Wahed, Kiet A. Nguyen, Yifan Shen, Tianjiao Yu, Ismini Lourentzou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反事实分割推理任务,通过反事实微调训练模型减少分割幻觉,实验表明其在减少幻觉和提升分割性能方面效果显著。

Comments Project webpage: https://plan-lab.github.io/hallusegbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15351 2025-12-15 cs.AI cs.CV 79%

Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration

Octopus: 六种能力协同的代理多模态推理

Yifu Guo, Zishan Xu, Zhiyuan Yao, Yuquan Lu, Jiaye Lin, Sen Hu, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11060 2025-12-15 cs.CV 78%

Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning

合成血管和病理增强视觉-语言模型推理

Chenjun Li, Cheng Wan, Laurin Lux, Alexander Berger, Richard B. Rosen, Martin J. Menten, Johannes C. Paetzold

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔·康奈尔医学) Technical University of Munich(慕尼黑技术大学) New York Eye and Ear Infirmary of Mount Sinai(圣文森特医院) Cornell Tech(康奈尔科技)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究提出合成血管推理框架,通过生成具有糖尿病视网膜病变特征的图像和文本,提升视觉-语言模型在OCTA图像诊断中的推理能力与病理定位精度。

Comments 23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05178 2025-12-15 cs.MA cs.AI 70%

CREW-WILDFIRE: Benchmarking Agentic Multi-Agent Collaborations at Scale

CREW-WILDFIRE:大规模代理协作基准测试

Jonathan Hyun, Nicholas R Waytowich, Boyuan Chen

机构 * Duke University(杜克大学) Army Research Laboratory(陆军研究实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 CREW-WILDFIRE是一个开源基准测试,用于评估大规模多代理协作的可扩展性、鲁棒性和协作能力,通过真实复杂的野火响应场景推动多代理Agentic AI的研究发展。

Comments Our project website is at: http://generalroboticslab.com/CREW-Wildfire

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19112 2025-12-15 cs.LG cs.AI 62%

Towards Practical Multi-label Causal Discovery in High-Dimensional Event Sequences via One-Shot Graph Aggregation

通过一次图聚合实现高维事件序列中实用的多标签因果发现

Hugo Math, Rainer Lienhart

机构 * BMW Group(宝马集团) Chair for Machine Learning and Computer Vision, Augsburg University(机器学习与计算机视觉主任,艾尔堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CARGO通过一次图聚合方法,在高维事件序列中实现高效的多标签因果发现,适用于医疗和车辆诊断等复杂场景。

Comments Accepted at NeurIPS2025 Workshop on Structured Probabilistic Inference and Generative Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11323 2025-12-15 cs.AI 57%

CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving

CAPTURE:一个用于LVLM在CAPTCHA解决中的基准和评估

Jianyi Zhang, Ziyin Zhou, Xu Ji, Shizhao Liu, Zhangchi Zhao

机构 * Beijing Electric Science and Technology Institute(北京电子科技研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CAPTURE是一个专为LVLM设计的CAPTCHA基准,涵盖4种主要类型和25种子类型,旨在全面评估LVLM在解决CAPTCHA任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11315 2025-12-15 cs.LG 57%

Benchmarking the Generality of Vision-Language-Action Models

对视觉-语言-动作模型通用性的基准测试

Pranav Guruprasad, Sudipta Chowdhury, Harsh Sikka, Mridul Sharma, Helen Lu, Sean Rivera, Aryan Khurana, Hangliang Ren, Yangyue Wang

机构 * Manifold Research Metarch AI Georgia Tech(佐治亚理工学院) Tufts University(塔夫茨大学) Northeastern University(东北大学) Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼) Institute for Research and Innovation in Intelligent Systems (IRIIS)(智能系统研究与创新研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出MultiNet v1.0基准,评估视觉-语言-动作模型在六个基础能力领域的跨领域泛化能力,发现现有模型在未见领域和模态转移时表现显著退化。

Comments 23 pages, 7 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10206 2025-12-15 cs.AI 57%

CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment

CP-Env:在可控医院环境中评估大型语言模型在临床路径中的表现

Yakun Zhu, Zhongzhen Huang, Qianhan Feng, Linjie Mu, Yannian Gu, Shaoting Zhang, Qi Dou, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CP-Env通过可控医院环境评估大型语言模型在复杂临床路径中的表现,揭示其在决策和伦理方面的挑战,并推动医疗AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13115 2025-12-15 eess.IV cs.AI cs.CV 57%

Multimodal Learning for Scalable Representation of High-Dimensional Medical Data

多模态学习用于高维医学数据的可扩展表示

Areej Alsaafin, Abubakr Shafique, Saghir Alfasly, Krishna R. Kalari, H. R. Tizhoosh

机构 * Kimia Lab, Dept. of Artificial Intelligence & Informatics, Mayo Clinic, Rochester, MN, USA(Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,MN,美国) Division of Computational Biology, Dept. of Quantitative Health Sciences, Mayo Clinic, Rochester, MN, USA(计算生物学部门,定量健康科学系,梅奥诊所,罗切斯特,MN,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MarbliX通过多模态学习实现高维医学数据的可扩展表示,提升癌症诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11680 2025-12-15 cs.CV 50%

Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing

跨模态上下文感知学习:用于遥感中视觉提示引导的多模态图像理解

Xu Zhang, Jiabin Fang, Zhuoming Ding, Jin Yuan, Xuan Liu, Qianjun Zhang, Zhiyong Li

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 CLV-Net通过跨模态上下文感知学习,利用视觉提示引导遥感多模态图像理解,提升目标识别精度和用户意图对齐能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06915 2025-12-15 cs.SE 50%

Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering

多Docker评估:软件工程自动环境构建的‘淘金之铲’基准

Kelin Fu, Tianyu Liu, Zeyu Shang, Yingwei Ma, Jian Yang, Jiaheng Liu, Kaigui Bian

专题命中 推理评测 :reasoning(abstract)

AI总结 Multi-Docker-Eval基准通过评估自动环境构建的性能,揭示了当前模型在成功率、效率及影响因素上的关键发现,为构建全自动SWE流水线提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11039 2025-12-15 cs.SD 50%

Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models

在帧之间倾听:在大型音频-语言模型中弥合时间缺口

Hualei Wang, Yiming Li, Shuo Ma, Hong Liu, Xiangdong Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 TimeAudio通过引入时间标记和绝对时间编码,提升大型音频-语言模型在时间定位和长音频理解上的能力,有效解决时间戳表示、架构和数据限制问题。

Comments Accepted by The Fortieth AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 8 篇

2508.11272 2025-12-15 cs.CV cs.AI 85%

Enhancing Supervised Composed Image Retrieval via Reasoning-Augmented Representation Engineering

通过推理增强的表示工程提升监督性复合图像检索

Jun Li, Hongjian Dou, Zhenyu Zhang, Kai Li, Shaoguo Liu, Tingting Gao

机构 * Jun Li(李俊) Hongjian Dou(董宏健) Zhenyu Zhang(张振宇) Kai Li(李凯) Shaoguo Liu(刘少国) Tingting Gao(高婷婷)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出PMTFR框架,通过推理增强的表示工程提升监督性复合图像检索性能,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11277 2025-12-15 cs.CL cs.LG 81%

When Actions Teach You to Think: Reasoning-Action Synergy via Reinforcement Learning in Conversational Agents

当行动教你思考:通过强化学习在对话代理中实现推理-行动协同

Mrinal Rawat, Arkajyoti Chakraborty, Neha Gupta, Roberto Pieraccini

机构 * Uniphore

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过强化学习实现对话代理中推理与行动的协同,提升模型推理质量和工具调用精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11099 2025-12-15 cs.CV 78%

VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction

VGent: 通过模块化设计实现视觉 grounding 的解耦推理与预测

Weitai Kang, Jason Kuen, Mengwei Ren, Zijun Wei, Yan Yan, Kangning Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Adobe(Adobe公司)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 VGent 通过模块化设计实现视觉 grounding 的解耦推理与预测,利用冻结 MLLM 和解码器交叉注意力机制,提升多目标识别性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18234 2025-12-15 cs.AI cs.CL cs.LG 67%

The Illusion of Readiness in Health AI

健康AI中的“准备”幻觉

Yu Gu, Jingjing Fu, Xiaodong Liu, Jeya Maria Jose Valanarasu, Noel CF Codella, Reuben Tan, Qianchu Liu, Ying Jin, Sheng Zhang, Jinyu Wang, Rui Wang, Lei Song, Guanghui Qin, Naoto Usuyama, Cliff Wong, Hao Cheng, HoHin Lee, Praneeth Sanapathi, Sarah Hilado, Tristan Naumann, Javier Alvarez-Valle, Jiang Bian, Mu Wei, Khalil Malik, Lidong Zhou, Jianfeng Gao, Eric Horvitz, Matthew P. Lungren, Doug Burger, Eric Topol, Hoifung Poon, Paul Vozila

机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11282 2025-12-15 cs.CL cs.AI 62%

CIP: A Plug-and-Play Causal Prompting Framework for Mitigating Hallucinations under Long-Context Noise

CIP: 一种用于在长上下文噪声下缓解幻觉的即插即用因果提示框架

Qingsen Ma, Dianyun Wang, Ran Jing, Yujun Sun, Zhenbo Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern University(西北大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CIP通过因果推理框架提升大语言模型的可解释性、稳定性和效率,有效缓解长上下文噪声下的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11458 2025-12-15 cs.CV cs.AI 57%

Boosting Skeleton-based Zero-Shot Action Recognition with Training-Free Test-Time Adaptation

通过无训练测试时适应提升基于骨架的零样本动作识别

Jingmin Zhu, Anqi Zhu, Hossein Rahmani, Jun Liu, Mohammed Bennamoun, Qiuhong Ke

机构 * Monash University(墨尔本大学) Lancaster University(兰卡斯特大学) University of Western Australia(西澳大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 通过引入Skeleton-Cache框架,利用LLM引导的语义先验实现无训练测试时适应,提升基于骨架的零样本动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10960 2025-12-15 cs.HC cs.AI 57%

Measuring skill-based uplift from AI in a real biological laboratory

在真实生物实验室中测量AI带来的基于技能的提升

Ethan Obie Romero-Severson, Tara Harvey, Nick Generous, Phillip M. Mach

机构 * Theoretical Biology and Biophysics Group, Los Alamos National Laboratory(理论生物学与生物物理学组,洛斯阿拉莫斯国家实验室) Biochemistry and Biotechnology Group, Los Alamos National Laboratory(生物化学与生物技术组,洛斯阿拉莫斯国家实验室) National Security AI Office, Los Alamos National Laboratory(国家安全人工智能办公室,洛斯阿拉莫斯国家实验室) National Security and Defense Program Office, Los Alamos National Laboratory(国家安全与防卫计划办公室,洛斯阿拉莫斯国家实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过对比AI推理模型和互联网访问对生物实验室技能提升的影响,探讨AI在生物安全中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11218 2025-12-15 cs.RO cs.CV 50%

Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy

视觉与语言动作政策的贝叶斯分解:看见以行动,提示以指定

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Shuqi Zhao, Qing Huang, Yifei Yang, Haojian Lu, Rong Xiong, Masayoshi Tomizuka, Yue Wang

机构 * Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出BayesVLA,通过贝叶斯分解策略,解决VLA模型中因模态不平衡导致的灾难性遗忘问题,提升泛化能力和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏