arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-16 至 2026-01-16 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2601.09876 2026-01-16 cs.CL 83%

Patient-Similarity Cohort Reasoning in Clinical Text-to-SQL

基于患者相似群体的临床文本到SQL推理

Yifei Shen, Yilun Zhao, Justice Ou, Tinglin Huang, Arman Cohan

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 CLINSQL基准测试集通过多表连接、临床意义过滤和多步骤查询,推动临床可靠的文本到SQL系统发展。

Comments Accepted by EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10712 2026-01-16 cs.CL cs.AI 81%

MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching

MatchTIR: 通过双图匹配实现工具集成推理的细粒度监督

Changle Qu, Sunhao Dai, Hengyi Cai, Jun Xu, Shuaiqiang Wang, Dawei Yin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MatchTIR通过双图匹配实现细粒度监督,提升工具集成推理在长周期多轮任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10109 2026-01-16 cs.CL 79%

Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation

具备技能的数据选择与微调用于数据高效的推理蒸馏

Lechen Zhang, Yunxiang Zhang, Wei Hu, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于技能的蒸馏框架,通过数据选择和微调提升推理效率,实验证明在数学推理基准上优于随机微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10228 2026-01-16 cs.CV cs.MM eess.IV 75%

Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge

优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案

Sicheng Yang, Yukai Huang, Shitong Sun, Weitong Cai, Jiankang Deng, Jifei Song, Zhensong Zhang

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。

Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10581 2026-01-16 cs.AI cs.IR 74%

From Single to Multi-Agent Reasoning: Advancing GeneGPT for Genomics QA

从单 agent 到多 agent 推理:提升 GeneGPT 的基因组 QA 能力

Kimia Abedini, Farzad Shami, Gianmaria Silvello

机构 * University of Padua, Italy(帕多瓦大学,意大利) Aalto University, Finland(阿alto大学,芬兰)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 GenomAgent通过多 agent框架提升基因组 QA 能力,实现对复杂基因组查询的高效处理,并在多个任务中超越现有系统。

Comments Accepted paper by the 48th European Conference on Information Retrieval (ECIR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10318 2026-01-16 cs.CL 70%

Boundary-Aware NL2SQL: Integrating Reliability through Hybrid Reward and Data Synthesis

边界感知的NL2SQL:通过混合奖励和数据合成集成可靠性

Songsong Tian, Kongsheng Zhuo, Zhendong Wang, Rong Shen, Shengtao Zhang, Yong Wu

机构 * Li Auto Inc.(Li汽车公司) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 BAR-SQL通过混合奖励和数据合成方法,提升NL2SQL在生成准确性和边界感知回避能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08763 2026-01-16 cs.LG cs.CL 62%

Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs

奖励罕见性:面向LLM创造性问题解决的唯一性感知强化学习

Zhiyuan Hu, Yucheng Wang, Yufei He, Jiaying Wu, Yilun Zhao, See-Kiong Ng, Cynthia Breazeal, Anh Tuan Luu, Hae Won Park, Bryan Hooi

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出唯一性感知强化学习方法,通过奖励罕见的高级策略提升LLM在复杂推理任务中的多样性与性能。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09714 2026-01-16 cs.CL cs.AI 62%

Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines

利用多工作流LLM管道评估AI生成的研究计划新颖性

Devesh Saraogi, Rohit Singhee, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,皮兰迪)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多工作流LLM管道评估AI生成研究计划的新颖性,发现递归分解和长上下文工作流在新颖性和可行性方面表现更优。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10167 2026-01-16 cs.CL 57%

Credit C-GPT: A Domain-Specialized Large Language Model for Conversational Understanding in Vietnamese Debt Collection

信用C-GPT:一种面向越南债务催收的领域专用大语言模型

Nhung Nguyen Thi Hong, Cuong Nguyen Dang, Tri Le Ngoc

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Credit C-GPT是一种针对越南债务催收场景优化的领域专用大语言模型,通过整合多任务对话智能,提升对话理解、情感识别和意图检测等能力,为企业呼叫中心提供实时帮助和分析解决方案。

Comments 8 pages, 0 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10088 2026-01-16 cs.AI 57%

State of AI: An Empirical 100 Trillion Token Study with OpenRouter

AI 状态:一项具有 OpenRouter 的 100 万亿 token 实证研究

Malika Aubakirova, Alex Atallah, Chris Clark, Justin Summerville, Anjney Midha

机构 * OpenRouter

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过分析 100 万亿 token 的真实世界 LLM 交互,揭示了 LLM 在实际应用中的复杂使用模式,包括开放式权重模型的普及、创意角色扮演的流行以及代理推理的兴起。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10551 2026-01-16 cs.CV 50%

Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure

释放大型视觉-语言模型的能力以实现道路基础设施的智能感知

Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出一种领域适应框架,通过数据高效微调和知识引导推理,提升大型视觉语言模型在城市道路基础设施感知中的性能和专业合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏