W&D:Scaling Parallel Tool Calling for Efficient Deep Research Agents
W&D:通过并行工具调用提升深度研究代理的效率
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 W&D 通过并行工具调用提升深度研究代理效率,实现性能提升和减少回合数。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
W&D:通过并行工具调用提升深度研究代理的效率
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 W&D 通过并行工具调用提升深度研究代理效率,实现性能提升和减少回合数。
MIXRAG : 基于专家混合的检索增强生成用于文本图理解与问答
机构 * Wayne State University(韦恩州立大学) ; Emory University(埃默里大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 MIXRAG通过专家混合图-RAG框架,利用多个专门化图检索器和动态路由控制器,提升复杂查询处理和噪声过滤能力,实现文本图理解和问答任务的高性能表现。
PreFlect:从回顾性到前瞻性反思在大语言模型代理中的应用
机构 * College of Information Sciences and Technology, The Pennsylvania State University, State College, PA, USA(信息科学与技术学院,宾夕法尼亚州立大学,州立学院,PA,美国)
专题命中 复杂问题求解 :planning(abstract);分类 cs.AI
AI总结 PreFlect通过前瞻性反思机制在执行前改进代理计划,提升复杂任务的性能,优于现有反思方法和更复杂的架构。
迈向可靠的基准测试:一种无污染、可控的多步骤LLM功能调用评估框架
机构 * Megagon Labs(Megagon实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文提出FuncBenchGen框架,通过生成多步骤工具使用任务评估LLM功能调用能力,发现依赖深度增加导致性能下降,引入重申变量值策略提升模型表现。
Comments ICLR 2026
DeepPrep: 一种基于大语言模型的自主数据准备代理系统
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 DeepPrep通过基于树状代理推理和渐进式训练框架,实现高效且准确的数据准备,相比闭源模型具有更低的成本和更广的适用性。
PBEBench: 一个受历史语言学启发的多步编程-by-例子推理基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Ohio State University(俄亥俄州立大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL
AI总结 PBEBench是一个受历史语言学启发的多步编程-by-例子推理基准,用于评估LLMs的归纳推理能力,发现模型在复杂任务中的表现存在显著差距。
MMTS-BENCH: 一个全面的时间序列理解和推理基准
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 MMTS-BENCH通过多模态基准评估大语言模型在时间序列理解与推理中的表现,揭示了TS-LLMs在跨领域泛化和多模态整合方面的不足。
SPD-Faith Bench: 诊断和改进多模态大语言模型中的推理忠实性
机构 * Xidian University(西安电子科技大学) ; National University of Singapore(新加坡国立大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SPD-Faith Bench通过细粒度图像差异推理诊断并改进多模态大语言模型中的推理忠实性,揭示了感知盲区和感知-推理脱节的系统性失败模式,并提出SAGE框架提升视觉路由和推理与感知的一致性。
Comments 53 pages, 42 figures, 14 tables
AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟
机构 * Peking University, Beijing, China(北京大学) ; Tsinghua University, Beijing, China(清华大学) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学) ; South China University of Technology, Guangzhou, China(华南理工大学)
专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI
AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。
通过端到端强化学习实现压缩内存中的动态长上下文推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种基于端到端强化学习的框架,通过分块压缩和选择性记忆回溯实现高效长上下文推理,提升了多跳推理任务的准确性和效率。
Comments 26 pages, 7 figures. Code and models will be released
用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准
机构 * Frontier Development Lab(前沿发展实验室) ; Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) ; Trillium Technologies Inc.(Trillium技术公司) ; Department of Engineering, University of Cambridge(工程系,剑桥大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。
Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar
在大语言模型中的确定性引导推理:一种动态思维预算方法
机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 CGR通过动态调整推理预算,在保持准确性的同时减少token使用,通过确定性评估实现高效的推理过程。
ExpliCa:评估大型语言模型中的显式因果推理
机构 * CoLing Lab, Department of Philology, Literature, and Linguistics, University of Pisa, Italy(皮尔森大学哲学、文学与语言学系协作语言实验室) ; Department of Informatics, University of Pisa, Italy(皮尔森大学信息学系) ; Department of Chinese and Bilingual Studies, The Hong Kong Polytechnic University(香港理工大学中文与双语研究系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 ExpliCa数据集用于评估大型语言模型在显式因果推理中的能力,发现顶级模型在准确率上仍存在显著不足,且模型性能受语言顺序和大小影响明显。
Comments Accepted for publication in Findings of ACL 2025
Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17335-17355, Vienna, Austria. Association for Computational Linguistics
非确定多项式时间问题挑战:为大语言模型构建的持续扩展推理基准
机构 * The Hong Kong Polytechnic University(香港理工大学) ; KTH Royal Institute of Technology(皇家理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Singapore Management University(新加坡管理学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 NPPC是一个持续扩展的推理基准,通过三个模块评估LLMs的推理能力,揭示其性能极限和改进方向。
Comments Accepted to TMLR
6G-Bench:面向AI原生6G网络的语义通信与网络级推理开放基准
机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿拉伯联合酋长国大学) ; G Research Center (6GRC), Khalifa University, UAE(6G研究中心(6GRC),哈利法大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 6G-Bench通过开放基准评估AI原生6G网络中的语义通信与网络级推理能力,涵盖22种基础模型,揭示了不同模型在语义推理上的显著差异。
HuggingR$^{4}$: 一种用于发现最优模型伙伴的渐进推理框架
机构 * Zhejiang University, Hangzhou, China(浙江大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 HuggingR$^4$通过渐进推理框架提升模型选择效率,实现更高的可行性与合理性,同时降低token消耗。
Comments 21 pages, 3 figures
在大型语言模型中进行会计推理:概念、评估与实证分析
机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文研究了会计推理的概念、评估方法及实证分析,发现GPT-4在会计推理任务中表现最佳,但现有LLMs仍需优化以满足实际应用需求。
VisionReasoner: 通过强化学习实现统一的推理集成视觉感知
机构 * CUHK(香港中文大学) ; SmartMore(SmartMore公司) ; HKUST(香港理工大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 VisionReasoner通过强化学习实现统一的推理集成视觉感知,其在检测、分割和计数任务中均取得优于基线模型的性能。
弱到强:基于VLM的伪标签作为多模态视频隐藏情绪理解任务中的弱监督训练策略
机构 * The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) ; The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) ; School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院) ; Shandong University of Technology, Beijing, China(山东理工大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出基于VLM的伪标签弱监督方法,用于多模态视频隐藏情绪识别,提升准确率至0.69并建立新基准。
跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测
机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) ; Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) ; Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) ; Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) ; Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。
Comments 18 pages, 7 figures, 6 tables
AVERE: 通过偏好优化提升音频视觉情感推理
专题命中 推理评测 :reasoning(title);分类 cs.LG
AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。
Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io
MemAdapter:通过生成子图检索实现跨代理记忆范式的快速对齐
机构 * The University of Manchester(曼彻斯特大学) ; Stanford University(斯坦福大学) ; Imperial College London(伦敦帝国理工学院) ; National Institute of Advanced Industrial Science(国家先进工业科学与技术研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MemAdapter通过生成子图检索实现跨代理记忆范式的快速对齐,提升记忆检索灵活性并降低对齐成本,实验显示其性能优于现有系统。
对殖民弗吉尼亚土地授予进行大规模语言模型评估
机构 * Independent Researcher(独立研究者)
专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究评估了大规模语言模型在将殖民弗吉尼亚土地授予描述转换为地理坐标方面的性能,发现模型在准确性与成本效益上表现优异。
Journal ref Journal of Spatial Information Science, No. 31 (2025), pp. 57-96
基于多模态大语言模型的高效表格检索与理解
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; AWS(亚马逊网络服务)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。
Comments Published at EACL 2026 Findings
通过在线强化学习与漏洞奖励模型实现安全代码生成
机构 * National University of Singapore(国立新加坡大学) ; Singapore Management University(新加坡管理学院) ; Nanyang Technological University(南洋理工大学) ; Monash University(墨尔本大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SecCoderX通过在线强化学习与漏洞奖励模型提升代码安全性,实现功能与安全性的平衡。
超越偏见分数:揭示小型语言模型中的空洞中性
机构 * George Mason University(乔治·马歇尔大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出空洞中性框架,评估小型语言模型的公平性与鲁棒性,揭示其在不同社会偏见类别中的隐藏漏洞。
Comments Accepted at EACL 2026 Student Research Workshop
大语言模型的税收视角:关于附加税收罚金的案例研究
机构 * University of Seoul(首尔大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨大语言模型在税收领域的能力,通过PLAT基准测试发现其在复杂法律推理任务中表现有限。
Comments 9 pages
Journal ref EACL 2026 main
BiomechAgent: 通过代码生成代理实现AI辅助的生物力学分析
机构 * Shirley Ryan AbilityLab Northwestern University(Shirley Ryan AbilityLab 北卡罗来纳大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 BiomechAgent通过自然语言和代码生成技术,使无标记运动捕捉数据的生物力学分析更易被非编程用户使用,提升临床应用的效率和准确性。
大型语言模型在人道主义危机响应中的地理信息提取
机构 * Universidad de San Andrés Victoria(圣安德烈斯大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出基于LLM的两步框架,通过结合命名实体识别和上下文地理编码模块,提升人道主义文档中地理信息提取的精度与公平性。
PERSPECTRA: 一种可扩展且可配置的多元视角论证基准
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 PERSPECTRA提出了一种结合结构清晰与语义多样性的多元视角论证基准,用于评估模型在处理多个视角时的表示、区分与推理能力。
Comments 15 pages, 1 figure