arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-15 至 2026-01-15 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 20 篇

2601.08676 2026-01-15 cs.AI 85%

Advancing ESG Intelligence: An Expert-level Agent and Comprehensive Benchmark for Sustainable Finance

推进ESG智能:一个专家级代理和全面的可持续金融基准

Yilei Zhao, Wentao Zhang, Lei Xiao, Yandan Zheng, Mengpu Liu, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ESGAgent多代理系统及三级基准,通过高准确率在原子问题回答和专业报告生成中超越现有LLMs,为可持续金融领域提供关键评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09393 2026-01-15 cs.SE cs.DC cs.PF 83%

AI-NativeBench: An Open-Source White-Box Agentic Benchmark Suite for AI-Native Systems

AI-NativeBench: 一个面向 AI-Native 系统的开源白盒代理基准测试套件

Zirui Wang, Guangba Yu, Michael R. Lyu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 AI-NativeBench 通过白盒代理基准测试揭示 AI-Native 系统中的关键工程现实,指导可靠系统构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09382 2026-01-15 cs.AI cs.CL 81%

Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments

长期任务导向代理:动态环境中主动的长期意图维护

Qinglong Shi, Donghai Wang, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Meituan(美团)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种主动任务导向代理,通过意图条件监控和事件触发跟进,提升动态环境中长期意图维护的能力,并通过ChronosBench验证了其有效性。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09688 2026-01-15 cs.CL 79%

DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation

DeepResearchEval: 一种用于深度研究任务构建和代理评估的自动化框架

Yibo Wang, Lei Wang, Yue Deng, Keming Wu, Yao Xiao, Huanjin Yao, Liwei Kang, Hai Ye, Yongcheng Jing, Lidong Bing

机构 * Infinity Lab, Shanda Group(沙达集团无限实验室) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 DeepResearchEval提出了一种自动化框架,通过基于角色的任务生成流程和自适应评估机制,解决深度研究任务构建和评估中的挑战。

Comments Source code: https://github.com/Infinity-AILab/DeepResearchEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08839 2026-01-15 cs.CL 79%

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

多LLM系统的递归知识合成:稳定性分析与三代理审计框架

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出三代理框架用于多LLM系统稳定性分析,通过递归知识合成实现安全可靠的知识生成。

Comments 25 pages, 9 figures. Pilot feasibility study using public-access large language models without API-level orchestration

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07309 2026-01-15 cs.CL 79%

Agent Bain vs. Agent McKinsey: A New Text-to-SQL Benchmark for the Business Domain

Agent Bain vs. Agent McKinsey:业务领域的新文本到SQL基准测试

Yue Li, Ran Tao, Derek Hommel, Yusuf Denizay Dönder, Sungyong Chang, David Mimno, Unso Eun Seo Jo

机构 * Cornell University(康奈尔大学) Gena AI

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL

AI总结 CORGI是一个新的文本到SQL基准测试,旨在评估业务领域中更复杂的问题,如预测和推荐,揭示LLM在处理复杂任务时的性能下降。

Comments 23 pages, under review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11773 2026-01-15 cs.CL 79%

AgenticIE: An Adaptive Agent for Information Extraction from Complex Regulatory Documents

AgenticIE: 一种用于从复杂监管文件中提取信息的自适应代理

Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) NEC Laboratories Europe(NEC欧洲实验室)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL

AI总结 本文提出AgenticIE系统,用于从复杂监管文件中提取信息和回答问题,通过高密度标注数据集验证其在KIE和QA任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20975 2026-01-15 cs.CV 78%

SPOT!: Map-Guided LLM Agent for Unsupervised Multi-CCTV Dynamic Object Tracking

SPOT!: 多CCTV动态目标跟踪的映射引导LLM代理

Yujin Roh, Inho Jake Park, Chigon Hwang

专题命中 Agent评测 :agent(title,abstract)

AI总结 SPOT通过映射引导LLM代理在多CCTV环境中实现无先验训练的动态目标跟踪,有效解决盲区导致的轨迹丢失问题。

Comments 33 pages, 27figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00377 2026-01-15 cs.HC cs.AI cs.CV cs.LG 76%

Beyond One-Size-Fits-All: A Survey of Personalized Affective Computing in Human-Agent Interaction

超越通用方案:人机交互中个性化情感计算的综述

Jialin Li, Maha Elgarf, Alia Waleed, Hanan Salam

机构 * Social Machines & Robotics (SMART) Lab, and the Center of AI & Robotics (CAIR), New York University, Abu Dhabi(社会机器与机器人(SMART)实验室,以及人工智能与机器人中心(CAIR),纽约大学阿布扎克分校) SMART Lab, New York University, Abu Dhabi(社会机器与机器人实验室,纽约大学阿布扎克分校)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 本文综述了人机交互中个性化情感计算的方法与挑战,提出分类体系并分析了不同交互模式和情境下的个性化技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08835 2026-01-15 cs.CL cs.AI 73%

DeliberationBench: When Do More Voices Hurt? A Controlled Study of Multi-LLM Deliberation Protocols

DeliberationBench: 当更多声音有害时?多LLM协商协议的受控研究

Vaarunay Kaushal, Taranveer Singh

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 DeliberationBench研究发现,多LLM协商协议在性能上远低于简单基线,挑战了复杂性提升质量的假设。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13291 2026-01-15 cs.CL cs.AI 73%

Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan's Intelligent Interaction Systems

更高满意度,更低成本:关于LLMs如何革新美团智能交互系统的技术报告

Xuxin Cheng, Ke Zeng, Zhiquan Cao, Linyi Dai, Wenxuan Gao, Fei Han, Ai Jian, Feng Hong, Wenxing Hu, Zihe Huang, Dejian Kong, Jia Leng, Zhuoyuan Liao, Pei Liu, Jiaye Lin, Xing Ma, Jingqing Ruan, Jiaxing Song, Xiaoyu Tan, Ruixuan Xiao, Wenhui Yu, Wenyu Zhan, Haoxing Zhang, Chao Zhou, Hao Zhou, Shaodong Zheng, Ruinian Chen, Siyuan Chen, Ziyang Chen, Yiwen Dong, Yaoyou Fan, Yangyi Fang, Yang Gan, Shiguang Guo, Qi He, Chaowen Hu, Binghui Li, Dailin Li, Xiangyu Li, Yan Li, Chengjian Liu, Xiangfeng Liu, Jiahui Lv, Qiao Ma, Jiang Pan, Cong Qin, Chenxing Sun, Wen Sun, Zhonghui Wang, Abudukelimu Wuerkaixi, Xin Yang, Fangyi Yuan, Yawen Zhu, Tianyi Zhai, Jie Zhang, Runlai Zhang, Yao Xu, Yiran Zhao, Yifan Wang, Xunliang Cai, Yangen Hu, Cao Liu, Lu Pan, Xiaoli Wang, Bo Xiao, Wenyuan Yao, Qianlin Zhou, Benchang Zhu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 美团通过WOWService技术报告,利用LLMs和多智能体架构提升智能交互系统,实现用户满意度提升和成本降低。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04133 2026-01-15 cs.AI 70%

Testing the Testers: Human-Driven Quality Assessment of Voice AI Testing Platforms

测试测试者:由人类驱动的语音AI测试平台质量评估

Miguel E. Andres, Vadim Fedorov, Rida Sadek, Enric Spagnolo-Arrizabalaga, Nadescha Trudel

机构 * Radboud University(拉德堡德大学) Unversitat Pompeu Fabra(庞培法拉大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出首个系统框架,通过人类中心基准测试评估语音AI测试平台的质量,揭示不同平台在模拟和评估质量上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09527 2026-01-15 cs.LG cs.AI cs.PF 62%

Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs

在消费级Blackwell GPU上进行私有LLM推理:为中小企业实现低成本本地部署的实用指南

Jonathan Knoop, Hendrik Holtmann

机构 * IE Business University(IE商学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了消费级Blackwell GPU在LLM推理中的性能,证明其在多数中小企业工作负载中可替代云服务,但长上下文RAG任务仍需高端GPU。

Comments 15 pages, 18 tables, 7 figures. Includes link to GitHub repository and Docker image for reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09400 2026-01-15 cs.LG 57%

Preliminary Tests of the Anticipatory Classifier System with Hindsight Experience Replay

前瞻性分类器系统的初步测试与回顾经验回放

Olgierd Unold, Stanisław Franczyk

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出ACS2HER,结合前瞻性机制与回顾经验回放,提升稀疏奖励环境下的学习效率,但伴随计算开销和分类器数量的增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09017 2026-01-15 cs.CL 57%

Multicultural Spyfall: Assessing LLMs through Dynamic Multilingual Social Deduction Game

多文化间谍迷局:通过动态多语言社交推理解谜游戏评估LLM

Haryo Akbarianto Wibowo, Alaa Elsetohy, Qinrong Cui, Alham Fikri Aji

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出通过动态多语言社交推理解谜游戏Spyfall评估LLM的多语言和多文化能力,发现非英语环境下模型表现较弱,提供了一种更稳健的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 57%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09354 2026-01-15 cs.GT cs.NE 50%

Measuring the benefits of lying in MARA under egalitarian social welfare

在平等社会福利下测量说谎的好处

Jonathan Carrero, Ismael Rodriguez, Fernando Rubio

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在平等社会福利下,通过遗传算法评估说谎带来的好处,探讨代理如何通过撒谎获取更多资源。

Comments This paper was published in 2020 IEEE International Conference on Systems, Man, and Cybernetics (SMC). The present version is the author's accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13101 2026-01-15 cs.CY 50%

The Impact of Generative AI on Content Platforms: A Two-Sided Market Analysis with Multi-Dimensional Quality Heterogeneity

生成式AI对内容平台的影响:具有多维质量异质性的双侧市场分析

Yukun Zhang, Tianyang Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过构建统一计算框架,分析生成式AI对内容平台经济中福利、不平等和多样性的影响,揭示算法多样性和促进创作机制在维持长尾参与和包容性社会福利中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09299 2026-01-15 cs.GT 50%

On the Fair Allocation to Asymmetric Agents with Binary XOS Valuations

在具有二元XOS估值的不对称代理上实现公平分配

Ziheng Chen, Bo Li, Zihan Luo, Jialin Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 在具有二元XOS估值的不对称代理中,研究了改进的APS公平分配和WMMS公平性,达到了1/2的近似比率。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17109 2026-01-15 physics.flu-dyn physics.comp-ph 50%

Super-resolution reconstruction of turbulent flows from a single Lagrangian trajectory

从单一拉格朗日轨迹重建湍流场的超分辨率重建

Hua-Lin Wu, Ao Xu, Heng-Dong Xi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出T2F模型用于从单一拉格朗日轨迹重建湍流场,结合物理信息损失函数的T2F+PINN模型进一步提升了梯度相关量的重建精度。

Comments 31 pages, 21 figures

Journal ref Journal of Fluid Mechanics 2026, 1026, A46

详情

展开后加载摘要…

URL PDF HTML 收藏