arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2604.05112 2026-04-08 cs.LG cs.AI cs.RO 62%

Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner

Vintix II:决策预训练变压器是一种可扩展的上下文强化学习者

Andrei Polubarov, Lyubaykin Nikita, Alexander Derevyagin, Artyom Grishin, Igor Saprygin, Aleksandr Serkov, Mark Averchenko, Daniil Tikhonov, Maksim Zhdanov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Alexey Zemtsov, Vladislav Kurenkov

机构 * Applied AI Institute(应用人工智能研究所) Innopolis University(因诺波利斯大学) HSE(高等经济学院) ITMO University(ITMO大学) NUST MISIS(国立科技大学MISIS) MSU(莫斯科国立大学) Humanoid(Humanoid公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Vintix II,通过Flow Matching扩展DPT,实现跨多领域任务的强化学习,提升泛化能力。

Comments ICLR 2026, Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04328 2026-04-08 cs.AI cs.LG cs.MA 62%

Soft Tournament Equilibrium

软锦标赛均衡

Saad Alqithami

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软锦标赛均衡(STE),通过可微框架直接从配对比较数据学习和计算多值锦标赛解,解决非传递性交互中的评估问题,提供更稳健的多值均衡评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 62%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04237 2026-04-07 cs.AI cs.CY cs.LG 62%

Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems

教育强化学习中的教学安全性:形式化并检测AI辅导系统中的奖励黑客

Oluseyi Olukola, Nick Rahimi

机构 * School of Computing Sciences and Computer Engineering(计算科学与计算机工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出教育强化学习的教学安全性四层模型及奖励黑客严重性指数,通过模拟实验发现奖励设计不足,需结合约束架构和认知需求以减少奖励黑客问题。

Comments 43 pages, 5 figures. Submitted to the International Journal of Artificial Intelligence in Education (IJAIED)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL 62%

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01241 2026-04-03 cs.NE cs.AI cs.LG 62%

A Learning-Based Cooperative Coevolution Framework for Heterogeneous Large-Scale Global Optimization

基于学习的异质大规模全局优化合作共演框架

Wenjie Qiu, Zixin Wang, Hongyu Fang, Zeyuan Ma, Yue-Jiao Gong

机构 * South China University of Technology(华南理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LH-CC框架,通过将优化过程建模为马尔可夫决策过程,动态选择适配的优化器以解决异质大规模全局优化问题,实验表明其在解质量和计算效率上优于现有方法。

Comments 13 pages, 5 figures, 3 tables. Accepted for publication in GECCO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00979 2026-04-03 cs.CL cs.AI 62%

Dual Optimal: Make Your LLM Peer-like with Dignity

双最优:使你的大语言模型具有尊严的同行

Xiangqi Wang, Yue Huang, Haomin Zhuang, Kehan Guo, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Dignified Peer框架,通过反阿谀和可信性对抗逃避服务模式,利用PersonaKnob数据集和容忍约束Lagrangian DPO算法,构建具有尊严和同行能力的语言模型代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00362 2026-04-02 cs.AI cs.LG 62%

In harmony with gpt-oss

与gpt-oss和谐共处

Borislav Mavrin

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究通过逆向工程gpt-oss-20b的工具调用机制,构建了原生和谐代理框架,实现了对OpenAI发布分数的独立复现,提升了工具调用精度和评分表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04497 2026-03-31 cs.CV cs.AI cs.CL 62%

Vision-Language Agents for Interactive Forest Change Analysis

用于交互式森林变化分析的视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。

Comments 5 pages, 4 figures, Accepted into IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21782 2026-03-31 cs.AI cond-mat.mtrl-sci cs.LG physics.chem-ph 62%

Accelerating Scientific Discovery with Autonomous Goal-evolving Agents

通过自主目标演化的代理加速科学发现

Yuanqi Du, Botao Yu, Tianyu Liu, Tony Shen, Junwu Chen, Jan G. Rittig, Kunyang Sun, Yikun Zhang, Aarti Krishnan, Yu Zhang, Daniel Rosen, Rosali Pirone, Zhangde Song, Bo Zhou, Cassandra Masschelein, Yingze Wang, Haorui Wang, Haojun Jia, Chao Zhang, Hongyu Zhao, Martin Ester, Nir Hacohen, Teresa Head-Gordon, Carla P. Gomes, Huan Sun, Chenru Duan, Philippe Schwaller, Wengong Jin

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAGA代理,通过双层架构自动设计优化目标函数,提升科学发现效率,应用于抗生素、纳米抗体等设计任务,取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27469 2026-03-31 cs.LG cs.AI 62%

KV Cache Quantization for Self-Forcing Video Generation: A 33-Method Empirical Study

KV缓存量化用于自驱动视频生成:一项33种方法的实证研究

Suraj Ranganath, Vaishak Menon, Anish Patnaik

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文通过33种量化和缓存策略变体,研究自驱动视频生成中KV缓存压缩的影响,发现FlowCache启发的INT4软剪枝方法在压缩率和内存使用上表现优异,但高保真方法存在运行时或内存成本问题,需结合实际需求选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27333 2026-03-31 cs.SE cs.AI 62%

ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair

ComBench:一个面向编译错误修复的仓库级真实世界基准

Jia Li, Zeyang Zhuang, Zhuangbin Chen, Yuxin Su, Wei Meng, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出ComBench,首个面向C/C++编译错误修复的仓库级真实世界基准,通过自动化框架系统挖掘GitHub CI历史中的真实失败案例,评估12种现代LLM在直接和代理修复设置下的表现,揭示模型在语法正确性与语义正确性上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16448 2026-03-31 cs.AI cs.LG 62%

Information-theoretic Distinctions Between Deception and Confusion

信息论视角下欺骗与混淆的区别

Robin Young

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文从信息论角度区分两种AI安全失效模式:欺骗对齐与目标漂移,揭示二者在人类-AI系统不同接口的信息分歧,提出形式化模型和思想实验,为大型语言模型对齐挑战提供新视角。

Comments Proceedings of the 14th IJCNLP and the 4th AACL (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26137 2026-03-30 cs.SE cs.AI 62%

ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation

面向仓库级别的软件工程评估的时间一致性基准

Xianpeng, Sun, Haonan Sun, Tian Yu, Sheng Ma, Qincheng Zhang, Lifei Rao, Chen Tian

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出时间一致性基准方法,通过冻结仓库时间点并利用历史代码知识评估未来任务,展示提示构造对软件工程评估的重要性。

Comments 10 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25197 2026-03-30 cs.AI cs.ET cs.HC cs.RO cs.SE 62%

The Competence Shadow: Theory and Bounds of AI Assistance in Safety Engineering

能力阴影:物理AI系统安全工程中AI辅助的理论与界限

Umair Siddique

机构 * Independent Research(独立研究)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨AI在安全工程中的辅助作用,提出能力阴影理论,揭示AI辅助可能带来的系统性盲区,并强调协作设计的重要性。

Comments 8 Pages, 3 Figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06882 2026-03-30 cs.DC cs.AI cs.LG cs.PF 62%

Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices

边缘设备上流处理服务的多维自动扩展

Boris Sedlak, Philipp Raith, Andrea Morichetta, Víctor Casamayor Pujol, Schahram Dustdar

机构 * TU Wien(维也纳工业大学) Universitat Pompeu Fabra(庞培法布拉大学) ICREA(加泰罗尼亚高等研究机构)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MUDAP平台,通过服务与资源维度的细粒度垂直扩展,结合RASK代理优化执行,实现边缘设备上流处理服务的多维自动扩展,减少SLO违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25946 2026-03-30 cs.CV cs.AI cs.LG 62%

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

面向端到端驾驶的碰撞感知视觉-语言学习:多模态违规数据集

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Nissan Motor Corporation(日产汽车公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VLAAD模型,通过多实例学习获取碰撞信号,提升驾驶评分,并在真实数据集上验证其泛化能力。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22767 2026-03-25 cs.AI cs.CL 62%

Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases

大语言模型代理能否生成真实世界证据?评估医学数据库中的观察性研究

Dubai Li, Yuxiang He, Yan Hu, Yu Tian, Jingsong Li

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究评估了大语言模型代理在生成真实世界证据方面的能力,通过RWE-bench基准测试,发现代理在生成完整证据包方面存在显著局限,需进一步改进验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19268 2026-03-23 cs.CL cs.AI 62%

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

面向燃烧科学的全栈领域增强:构建与优化

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen

机构 * Peking University(北京大学) AI for Science Institute, Beijing(AI for Science研究院,北京)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出首个针对燃烧科学的全栈领域增强LLM工作流程,整合自动领域语料构建、增量预训练、指令微调及可验证奖励强化学习,构建标准化评估基准FlameBench,显著提升燃烧科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19173 2026-03-20 cs.LG cs.AI 62%

SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits

SOL-ExecBench:面向真实世界GPU内核的光速基准测试,针对硬件极限

Edward Lin, Sahil Modi, Siva Kumar Sastry Hari, Qijing Huang, Zhifan Ye, Nestor Qin, Fengzhe Zhou, Yuan Zhang, Jingquan Wang, Sana Damani, Dheeraj Peri, Ouye Xie, Aditya Kane, Moshe Maor, Michael Behar, Triston Cao, Rishabh Mehta, Vartika Singh, Vikram Sharma Mailthody, Terry Chen, Zihao Ye, Hanfeng Chen, Tianqi Chen, Vinod Grover, Wei Chen, Wei Liu, Eric Chung, Luis Ceze, Roger Bringmann, Cyril Zeller, Michael Lightstone, Christos Kozyrakis, Humphrey Shi

机构 * NVIDIA

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 SOL-ExecBench通过235个CUDA内核优化问题,针对NVIDIA Blackwell GPU的硬件极限,提出基于Speed-of-Light(SOL)的基准测试方法,评估内核优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17683 2026-03-19 cs.AI cs.LG 62%

Sensi: Learn One Thing at a Time -- Curriculum-Based Test-Time Learning for LLM Game Agents

Sensi:一次学一项——基于课程的学习式测试时间学习用于LLM游戏代理

Mohsen Arjmandi

机构 * Independent Researcher (CTO, evolutionID)(独立研究者(CTO, evolutionID))

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Sensi通过结构化测试时间学习机制,提升LLM游戏代理在未知环境中的学习效率,其核心方法包括双玩家架构、课程学习系统和数据库作为控制平面,显著提高了样本效率。

Comments Preprint. 18 pages, 5 figures, 2 tables. Independent research. Code and Colab demo coming soon on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17385 2026-03-19 cs.LG cs.AI cs.CV 62%

Den-TP: A Density-Balanced Data Curation and Evaluation Framework for Trajectory Prediction

Den-TP:一种基于密度平衡的数据整理与评估框架用于轨迹预测

Ruining Yang, Yi Xu, Yun Fu, Lili Su

机构 * Northeastern University, USA(东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Den-TP框架,通过密度感知的数据整理和评估方法,平衡轨迹预测数据集的密度分布,提升模型鲁棒性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17324 2026-03-19 cs.AI cs.LG 62%

ShuttleEnv: An Interactive Data-Driven RL Environment for Badminton Strategy Modeling

ShuttleEnv:一种用于羽毛球策略建模的交互式数据驱动RL环境

Ang Li, Xinyang Gong, Bozhou Chen, Yunlong Lu, Jiaming Ji, Yongyi Wang, Yaodong Yang, Wenxin Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍ShuttleEnv,一种基于精英球员比赛数据的交互式数据驱动RL环境,通过显式概率模型模拟比赛动态,支持强化学习和战略行为分析,提供实时可视化以探索不同打法和策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21750 2026-03-19 cs.CV cs.AI cs.CL cs.RO 62%

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

SO-Bench:多模态大语言模型的结构输出评估

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang, Zhifeng Chen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SO-Bench基准,评估多模态大语言模型在视觉输入下的结构化输出能力,揭示模型在准确性和符合数据模式方面的不足,并通过训练实验提升其结构化输出能力。

Comments v3 preprint. Added the link to the public benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14769 2026-03-17 cs.LG cs.AI 62%

POLCA: Stochastic Generative Optimization with LLM

POLCA:基于LLM的随机生成优化

Xuanfei Ren, Allen Nie, Tengyang Xie, Ching-An Cheng

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出POLCA框架,通过生成语言模型作为优化器,结合数值奖励和文本反馈,解决复杂系统的随机生成优化问题,实现高效探索与利用的平衡,实验表明其在多种基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07112 2026-03-17 cs.CL cs.AI 62%

More Agents Improve Math Problem Solving but Adversarial Robustness Gap Persists

更多代理提升数学问题解决能力但对抗鲁棒性差距依然存在

Khashayar Alavi, Zhastay Yeltay, Lucie Flek, Akbar Karimi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了多个代理在数学问答中的表现,发现协作提升准确性但对抗鲁棒性差距持续存在,人类错误仍是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23586 2026-03-17 cs.SE cs.AI 62%

Reducing Cost of LLM Agents with Trajectory Reduction

通过轨迹缩减降低LLM代理的成本

Yuan-An Xiao, Pengfei Gao, Chao Peng, Yingfei Xiong

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AgentDiet方法,通过减少LLM代理轨迹中的冗余信息,降低计算成本,实验显示可减少输入token和总计算成本达39.9%-59.7%和21.1%-35.9%。

Comments 22 pages, 5 figures; accepted for FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13168 2026-03-16 cs.AI cs.CL cs.IR 62%

Developing and evaluating a chatbot to support maternal health care

开发和评估一个支持产科保健的聊天机器人

Smriti Jha, Vidhi Jain, Jianyu Xu, Grace Liu, Sowmya Ramesh, Jitender Nagpal, Gretchen Chapman, Benjamin Bellows, Siddhartha Goyal, Aarti Singh, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Population Council Institute(人口理事会研究所) Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) Nivi, Inc.(Nivi公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。

Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12744 2026-03-16 cs.LG cs.AI cs.LO 62%

TaoBench: Do Automated Theorem Prover LLMs Generalize Beyond MathLib?

TaoBench: 自动定理证明器LLM是否能超越MathLib?

Alexander K Taylor, Junyi Zhang, Ethan Ji, Vigyan Sahai, Haikang Deng, Yuanzhou Chen, Yifan Yuan, Di Wu, Jia-Chen Gu, Kai-Wei Chang, Nanyun Peng, Amit Sahai, Wei Wang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 TaoBench评估了当前ATP系统在非标准定义框架下的鲁棒性,发现其在定义等价的Tao公式上性能下降26%,表明定义框架的泛化能力是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12483 2026-03-16 cs.AI cs.LG 62%

Generating Expressive and Customizable Evals for Timeseries Data Analysis Agents with AgentFuel

通过AgentFuel生成具有表现力和可定制性的时序数据分析代理评估

Aadyaa Maddi, Prakhar Naval, Deepti Mande, Shane Duan, Muckai Girish, Vyas Sekar

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了6种流行的数据分析代理,发现其在状态性和事件特定查询上表现不足,并提出AgentFuel工具,帮助领域专家生成定制化的评估方案,提升代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏