arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2510.05609 2026-02-03 cs.CV cs.AI 57%

HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection

HOI-R1: 探索多模态大语言模型在人类-物体交互检测中的潜力

Junwen Chen, Peilin Xiong, Keiji Yanai

机构 * Department of Informatics, The University of Electro-Communications(信息学系,东京电通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 HOI-R1利用多模态大语言模型的推理能力,无需额外模块实现人类-物体交互检测任务的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00028 2026-02-03 cs.LG cs.MM 57%

ELLMPEG: An Edge-based Agentic LLM Video Processing Tool

ELLMPEG:一种基于边缘的代理LLM视频处理工具

Zoha Azimi, Reza Farahani, Radu Prodan, Christian Timmerer

机构 * Christian Doppler Laboratory ATHENA, Department of Information Technology (ITEC) University of Klagenfurt(亚琛实验室ATHENA,信息科技系,克雷格弗尔特大学) Department of Information Technology (ITEC) University of Klagenfurt(信息科技系,克雷格弗尔特大学) Department of Computer Science University of Innsbruck(计算机科学系,因斯布鲁克大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 ELLMPEG是一种基于边缘的代理LLM视频处理工具,通过整合工具感知的检索增强生成与迭代自我反思,实现本地生成和验证FFmpeg和VVenC命令,提升视频处理效率和准确性。

Comments 12 pages, 5 tables, 8 Figures, accepted for the MMSys 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22885 2026-02-02 cs.CL 57%

Leveraging LLMs For Turkish Skill Extraction

利用LLMs进行土耳其语技能提取

Ezgi Arslan İltüzer, Özgür Anıl Özlü, Vahid Farajijobehdar, Gülşen Eryiğit

机构 * Kariyer.net, R&D Center(Kariyer.net 研发中心) Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文利用LLMs提升土耳其语技能提取性能,提出首个土耳其语技能提取数据集,并通过端到端流程实现0.56的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21558 2026-02-02 cs.CL 57%

ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement Arenas

ASTRA: 自动化合成代理轨迹与强化环境

Xiaoyu Tian, Haotian Wang, Shuaiting Chen, Hao Zhou, Kaichi Yu, Yudian Zhang, Jade Ouyang, Junxi Yin, Jiong Chen, Baoyan Guo, Lei Zhang, Junjie Tao, Yuansheng Song, Ming Cui, Chengwei Liu

机构 * Beike Language and Intelligence(北溪语言与智能)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ASTRA通过可扩展数据合成和可验证强化学习,自动化训练工具增强语言模型代理,实现多轮稳定学习和高性能工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13926 2026-02-02 cs.CL 57%

BioMedSearch: A Multi-Source Biomedical Retrieval Framework Based on LLMs

BioMedSearch: 基于LLMs的多源生物医学检索框架

Congying Liu, Xingyuan Wei, Peipei Liu, Yiqing Shen, Yanxu Mao, Tiehan Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Johns Hopkins University(约翰霍普金斯大学) Henan University(河南大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 BioMedSearch基于LLMs构建多源生物医学检索框架,通过整合文献、蛋白质数据库和网络搜索,提升复杂生物医学问题的准确回答能力。

Journal ref Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08613 2026-02-02 cs.CL 57%

GraphGhost: Tracing Structures Behind Large Language Models

GraphGhost: 探索大型语言模型背后的结构

Xinnan Dai, Xianxuan Long, Chung-Hsiang Lo, Kai Guo, Shenglai Zeng, Dongsheng Luo, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Northeastern University(东北大学) Florida International University(佛罗里达国际大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 GraphGhost通过图分析揭示大型语言模型内部结构,捕捉推理过程中的关键节点与信息流,为理解模型决策提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21822 2026-01-30 cs.AI 57%

CORE:Toward Ubiquitous 6G Intelligence Through Collaborative Orchestration of Large Language Model Agents Over Hierarchical Edge

CORE:通过分层边缘的协作编排实现无处不在的6G智能

Zitong Yu, Boquan Sun, Yang Li, Zheyan Qu, Xing Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 CORE通过协作编排多个LLM代理在分层边缘网络中实现高效任务处理,提升6G环境下的系统效率和任务完成率。

Comments Accepted by IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21469 2026-01-30 cs.SE cs.AI 57%

Adaptive Confidence Gating in Multi-Agent Collaboration for Efficient and Optimized Code Generation

多智能体协作中的自适应置信度门控:用于高效优化的代码生成

Haoji Zhang, Yuzhe Li, Zhenqiang Liu, Chenyang Liu, Shenyang Zhang, Yi Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DebateCoder通过多智能体协作和自适应置信度门控机制,提升小型语言模型在复杂逻辑任务中的代码生成效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21208 2026-01-30 cs.AI cs.IR 57%

When should I search more: Adaptive Complex Query Optimization with Reinforcement Learning

我应该何时搜索更多:基于强化学习的自适应复杂查询优化

Wei Wen, Sihang Deng, Tianjun Wei, Keyu Chen, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯云图实验室) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自适应复杂查询优化框架ACQO,通过强化学习解决复杂查询优化中的子查询数量确定、文档排序与合并问题,实现更稳定高效的查询处理。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00856 2026-01-29 econ.EM cs.AI 57%

Can AI Master Econometrics? Evidence from Econometrics AI Agent on Expert-Level Tasks

AI能否掌握计量经济学?来自计量经济学AI代理在专家级任务上的证据

Qiang Chen, Tianyang Han, Jin Li, Ye Luo, Zigan Wang, Yuxiao Wu, Xiaowei Zhang, Tuo Zhou

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 本文提出MetricsAI,一个基于MetaGPT框架的计量经济学AI代理,通过实证分析展示其在专家级任务中超越传统模型的能力,推动社会科学研究的智能化与教育应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03578 2026-01-29 cs.MA cs.AI 57%

LLM Multi-Agent Systems: Challenges and Open Problems

大语言模型多智能体系统:挑战与开放问题

Shanshan Han, Qifan Zhang, Weizhao Jin, Zhaozhuo Xu

机构 * University of California, Irvine, CA, USA(加州大学尔湾分校) University of Southern California, Los Angeles, CA, USA(南加州大学) Stevens Institute of Technology, Hoboken, NJ, USA(史蒂文斯理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了多智能体系统在任务分配、推理增强和内存管理方面的挑战,并探讨其在区块链中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19871 2026-01-28 cs.CL 57%

Reflective Translation: Improving Low-Resource Machine Translation via Structured Self-Reflection

反思性翻译:通过结构化自我反思改进低资源机器翻译

Nicholas Cheng

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出反思性翻译框架,通过结构化自我反思提升低资源语言的机器翻译质量,实验表明其在BLEU和COMET评分上均有显著提升。

Comments 12 pages, 3 figures, 6 tables. Accepted to the NeurIPS 2025 Workshop on Multilingual Representation Learning (Mexico City) and the AAAI 2025 Workshop on Language Models for Under-Resourced Communities (LM4UC). Code and data available at: https://github.com/Nickcheng123/reflective-translation-mt

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19053 2026-01-28 cs.HC cs.AI 57%

From Answer Givers to Design Mentors: Guiding LLMs with the Cognitive Apprenticeship Model

从答案提供者到设计导师:通过认知 apprenticeship 模型引导 LLMs

Yongsu Ahn, Lejun R Liao, Benjamin Bach, Nam Wook Kim

机构 * Boston College(波士顿学院) Inria(法国国家信息与自动化技术研究院) University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过认知 apprenticeship 模型引导 LLMs 作为设计导师,提升设计推理和反思反馈质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13887 2026-01-28 cs.AI 57%

Human Simulation Computation: A Human-Inspired Framework for Adaptive AI Systems

人类模拟计算:一种受人类启发的自适应人工智能系统框架

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出人类模拟计算框架,通过结合人类思维策略与行动反馈,提升AI在动态环境中的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23581 2026-01-28 cs.LG 57%

GraphRAG-R1: Graph Retrieval-Augmented Generation with Process-Constrained Reinforcement Learning

GraphRAG-R1: 基于过程约束强化学习的图检索增强生成

Chuanyue Yu, Kuo Zhao, Yuhan Li, Heng Chang, Mingjian Feng, Xiangzhe Jiang, Yufei Sun, Jia Li, Yuzhi Zhang, Jianxin Li, Ziwei Zhang

机构 * Nankai University(南开大学) Huawei Technologies Ltd(华为技术有限公司) Beihang University(北航)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 GraphRAG-R1通过过程约束强化学习提升LLM多跳推理能力,结合改进的GRPO方法和两种新型奖励函数,有效解决复杂问题。

Comments Accepted by the Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18924 2026-01-28 cs.AI 57%

RIFT: Reordered Instruction Following Testbed To Evaluate Instruction Following in Singular Multistep Prompt Structures

RIFT:重新排列指令跟随测试床以评估单步提示结构中的指令跟随

Andrew Jaffe, Noah Reicin, Jinho D. Choi

机构 * Emory University(埃默里大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 RIFT通过测试不同提示结构下的LLM表现,揭示了指令跟随对位置连续性的强依赖,指出当前架构将指令跟随视为顺序模式而非推理能力。

Comments 13 pages, 5 figures, submitted to ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18847 2026-01-28 cs.SE cs.AI 57%

MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution

MulVul: 通过跨模型提示进化实现检索增强的多智能体代码漏洞检测

Zihan Wu, Jie Xu, Yun Peng, Chun Yong Chong, Xiaohua Jia

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 MulVul通过跨模型提示进化实现多智能体代码漏洞检测,采用由粗到细的策略,利用检索工具提升漏洞识别精度,达到34.79%的Macro-F1成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18281 2026-01-27 cs.CL cs.SD 57%

Reflecting Twice before Speaking with Empathy: Self-Reflective Alternating Inference for Empathy-Aware End-to-End Spoken Dialogue

在富有同理心之前两次反思:用于富有同理心的端到端语音对话的自我反思交替推理

Yuhang Jia, Pei Liu, Haoqin Sun, Jiaming Zhou, Xuxin Cheng, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ReEmpathy通过自我反思交替推理机制提升语音对话的同理心表现,实现更情感智能的人机交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17971 2026-01-27 cs.CL 57%

LLMs as Cultural Archives: Cultural Commonsense Knowledge Graph Extraction

LLMs作为文化档案:文化常识知识图谱提取

Junior Cedric Tonga, Chen Cecilia Liu, Iryna Gurevych, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Ubiquitous Knowledge Processing Lab (UKP Lab)(无处不在知识处理实验室) Department of Computer Science(计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) Technische Universität Darmstadt(德累斯顿技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于提示的框架,用于构建文化常识知识图谱,通过LLMs作为文化档案提取文化特定知识,提升文化推理和故事生成性能。

Comments EACL 2026 MAIN

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17735 2026-01-27 cs.AI 57%

ReFuGe: Feature Generation for Prediction Tasks on Relational Databases with LLM Agents

ReFuGe:基于LLM代理的关联数据库预测任务特征生成

Kyungho Kim, Geon Lee, Juyeon Kim, Dongwon Choi, Shinhwan Kang, Kijung Shin

机构 * KAIST(韩国科学技术院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ReFuGe通过LLM代理生成关联数据库预测任务的特征,提升预测性能。

Comments Accepted in ACM WWW 2026 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14047 2026-01-27 cs.GT cs.AI cs.MA cs.SI econ.TH 57%

Collective intelligence in science: direct elicitation of diverse information from experts with unknown information structure

科学中的集体智慧:通过未知信息结构直接获取专家多样化信息

Alexey V. Osipov, Nikolay N. Osipov

机构 * Swiss Re Institute(瑞士再保险学院) St. Petersburg State University(圣彼得堡国立大学) St. Petersburg Department of V. A. Steklov Institute of Mathematics of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡维克托·阿列克谢耶维奇·斯捷克洛夫数学研究所圣彼得堡分所) HSE University(俄罗斯高等经济大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 通过结合预测市场和聊天机制,实现专家在未知信息结构下高效共享信息,从而提升科学问题的集体分析效率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04861 2026-01-27 cs.AI 57%

Orchestrating Intelligence: Confidence-Aware Routing for Efficient Multi-Agent Collaboration across Multi-Scale Models

协调智能:基于置信度的路由机制用于高效多智能体协作跨多尺度模型

Jingbo Wang, Sendong Zhao, Jiatong Liu, Haochun Wang, Wanting Li, Bing Qin, Ting Liu

机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology, China(社会科学与信息检索研究中心,哈尔滨工业大学,中国) the Institute of Automation of the Chinese Academy of Sciences, China(中国科学院自动化研究所,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 OI-MAS通过基于置信度的路由机制,实现高效多智能体协作,提升准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11266 2026-01-27 cs.SE cs.AI 57%

Live API-Bench: 2500+ Live APIs for Testing Multi-Step Tool Calling

Benjamin Elder, Anupama Murthi, Jungkoo Kang, Ankita Rajaram Naik, Kiran Kate, Kinjal Basu, Danish Contractor

机构 * IBM Research AI(IBM人工智能研究实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments 11+32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15876 2026-01-26 cs.AI 57%

EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience

EvoCUA:通过可扩展的合成经验学习来进化计算机使用代理

Taofeng Xue, Chong Peng, Mianqiu Huang, Linsen Guo, Tiancheng Han, Haozhe Wang, Jianing Wang, Xiaocheng Zhang, Xin Yang, Dengchang Zhao, Jinrui Ding, Xiandi Ma, Yuchen Xie, Peng Pei, Xunliang Cai, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港理工大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 EvoCUA通过可扩展的合成经验学习进化计算机使用代理,实现更高性能和通用性。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07519 2026-01-23 cs.IR cs.CL 57%

GRITHopper: Decomposition-Free Multi-Hop Dense Retrieval

GRITHopper:无分解多跳密集检索

Justus-Jonas Erker, Nils Reimers, Iryna Gurevych

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 GRITHopper-7B通过结合生成和表示指令微调,提出了一种无分解多跳密集检索模型,实现了在分布内和分布外基准上的最佳性能。

Comments Accepted at EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15676 2026-01-23 cs.SD cs.LG eess.AS 57%

Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems

弥合感知差距:一种轻量级由粗到细架构用于边缘音频系统

Hengfan Zhang, Yueqian Lin, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 CoFi-Agent通过工具增强的条件边缘-云协作,在边缘音频系统中实现了更高效的感知与准确性提升。

Comments 10 pages, 3 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15476 2026-01-23 cs.AI cs.PF 57%

Reliability by design: quantifying and eliminating fabrication risk in LLMs. From generative to consultative AI: a comparative analysis in the legal domain and lessons for high-stakes knowledge bases

可靠性设计:量化并消除大语言模型中的制造风险。从生成式到咨询式AI:法律领域中的比较分析及对高风险知识库的启示

Alex Dantart

机构 * Humanizing Internet

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本文提出通过减少幻觉提升大语言模型在法律领域的可靠性,引入两种可靠性指标,并展示先进的 RAG 系统有效降低伪造事实率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15316 2026-01-23 cs.AI cs.CV 57%

The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection

范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查

Wei Ai, Yilong Tan, Yuntao Shou, Tao Meng, Haowen Chen, Zhixiong He, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15164 2026-01-22 cs.RO cs.AI 57%

V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks

V-CAGE:面向可扩展长时间跨度具身任务的上下文感知生成与验证

Yaru Liu, Ao-bo Wang, Nanyang Ye

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, England.(计算机科学与技术系,剑桥大学,剑桥,英格兰) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) Wuhan University, Wuhan, Hubei, China(武汉大学,武汉,湖北,中国)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 V-CAGE通过上下文感知生成与验证框架,提升大规模具身任务数据集的物理和语义保真度,提高下游策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14470 2026-01-22 cs.SE cs.AI cs.MA 57%

Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering

令牌经济学:量化令牌在代理软件工程中的使用位置

Mohamad Salim, Jasmine Latendresse, SayedHassan Khatoonabadi, Emad Shihab

机构 * Data-driven Analysis of Software (DAS) Lab Concordia University Montreal Canada Data-driven Analysis of Software (DAS) Lab Concordia University

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究通过分析LLM-MA系统在软件开发生命周期中的令牌消耗,发现代码审查阶段消耗最大,提出优化代理协作效率的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏