arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2601.19923 2026-05-18 cs.CL cs.AI 62%

Structure-BiEval: A Self-Supervised, Dual-Track Framework for Decoupling Structure and Content in LLM Evaluation for Web Information Systems

Structure-BiEval: 一种自监督、双轨框架,用于解耦Web信息系统中LLM评估的结构与内容

Boxiang Zhao, Qince Li, Zhonghao Wang, Zelin Cao, Yi Wang, Peng Cheng, Bo Lin

机构 * Tele-Communication Technology Bureau, Xinhua News Agency(新华通讯社电信技术局)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Structure-BiEval框架,通过确定性中间表示解耦结构与内容,利用内容语义准确性和归一化树编辑距离评估Web数据工程中的LLM结构 fidelity,发现不同模型在Web数据格式化中表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14744 2026-05-15 cs.CL cs.AI cs.CY 62%

Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

针对LLM治理的机械执行:在金融决策系统中治理-任务解耦的证据

José Manuel de la Chica Rodríguez, Carlos Martí-González

机构 * Santander AI Lab(Santander AI实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出五种治理指标,用于评估政策在决策理由层面的合规性,并在合成银行领域比较纯文本治理与机械执行的效果,发现机械执行能显著提升决策信息内容和任务准确性,表明治理与任务评估是两个独立的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14501 2026-05-15 eess.SY cs.AI cs.LG cs.SY 62%

Fully Dynamic Rebalancing in Dockless Bike-Sharing Systems via Deep Reinforcement Learning

通过深度强化学习实现无桩自行车共享系统的全动态再平衡

Edoardo Scarpel, Alberto Pettena, Matteo Cederle, Federico Chiariotti, Marco Fabris, Gian Antonio Susto

机构 * University of Padua(帕多瓦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于图的模拟器和马尔可夫决策过程的深度强化学习方法,实现无桩自行车共享系统的全动态再平衡,减少车辆短缺并降低空间不平等。

Comments 6 pages, 5 figures, 1 table, accepted at the 23rd IFAC World Congress, Busan, South Korea, Aug. 23-26, 2026. Open invited track 9-131: "Control and Optimization for Smart Cities"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07833 2026-05-15 cs.LG cs.AI 62%

Gradient Iterated Temporal-Difference Learning

梯度迭代时间差学习

Théo Vincent, Kevin Gerhardt, Yogesh Tripathi, Habib Maraqten, Adam White, Martha White, Jan Peters, Carlo D'Eramo

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出梯度迭代时间差学习方法,通过计算移动目标的梯度提升学习速度,对比半梯度方法在Atari游戏等基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14034 2026-05-15 cs.AI cs.CL cs.CY 62%

From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents

从描述性到规范性:揭示基于大语言模型的智能体的社会价值对齐

Jinxian Qu, Qingqing Gu, Teng Chen, Luo Ji

机构 * Geely AI Lab(Geely人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于价值的框架,利用GraphRAG将原则转化为价值指令,通过检索合适指令引导智能体行为,基于马斯洛需求层次和普鲁奇克情感轮理论评估预期行为,实验显示在DAILYDILEMMAS基准上优于基线方法。

Comments Accepted by CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02038 2026-05-14 cs.CL cs.AI cs.DB 62%

BEAVER: An Enterprise Benchmark for Text-to-SQL

BEAVER:一个企业文本到SQL基准测试

Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

机构 * MIT(麻省理工学院) Harvard University(哈佛大学) Greenshoe, Inc.(Greenshoe公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 BEAVER是首个基于企业私有数据仓库构建的文本到SQL基准测试,包含9128个问题-SQL对和19个领域的812张表,通过合成高质量查询和细粒度评估方法,揭示了现有模型在复杂企业场景下的性能差距。

Comments Dataset and code are available at https://beaverbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13045 2026-05-14 cs.LG cs.CL 62%

Large Language Models Lack Temporal Awareness of Medical Knowledge

大语言模型缺乏医学知识的时间意识

Zihan Guan, Qiao Jin, Guangzhi Xiong, Fangyuan Chen, Mengxuan Hu, Qingyu Chen, Yifan Peng, Zhiyong Lu, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) National Institutes of Health(美国国家卫生研究院) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Yale University(耶鲁大学) Weill Cornell Medicine(韦氏 Cornell 医学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TempoMed-Bench基准测试,揭示大语言模型在医学知识时间意识方面的不足,包括知识衰减、历史知识回忆困难及时间不一致行为,指出整合代理搜索工具难以解决该问题。

Comments 35 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12653 2026-05-14 cs.LG cs.AI stat.ML 62%

Plan Before You Trade: Inference-Time Optimization for RL Trading Agents

先规划再交易:用于强化学习交易代理的推理时间优化

Eun Go, Rohan Deb, Arindam Banerjee

机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FPILOT框架,通过预测价格轨迹优化交易策略,提升总回报和风险调整指标,适用于各种预训练代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12477 2026-05-13 cs.LG cs.CL 62%

MEME: Multi-entity & Evolving Memory Evaluation

MEME:多实体与演进记忆评估

Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh

机构 * KAIST AI(韩国科学技术院人工智能实验室) Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) NAVER AI Lab(NAVER人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨多实体与演进内存系统在持续环境中的表现,发现默认配置下所有系统在依赖推理上表现不佳,仅文件型代理配合Claude Opus 4.7能部分改善,但成本高且不实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12233 2026-05-13 cs.LG cs.AI cs.CR 62%

No More, No Less: Task Alignment in Terminal Agents

无需更多,无需更少:终端代理的任务对齐

Sina Mavali, David Pape, Jonathan Evertz, Samira Abedini, Devansh Srivastav, Thorsten Eisenhofer, Sahar Abdelnabi, Lea Schönherr

机构 * CISPA Helmholtz Center for Information Security(CISPA 涅槃中心信息安全研究所) ELLIS Institute Tübingen and MPI for Intelligent Systems(图宾根 ELLIS 研究所和智能系统 MPI) Tübingen AI Center(图宾根人工智能中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨终端代理在复杂任务中如何选择性使用环境指令,提出TAB基准测试揭示任务能力与对齐之间的差距,显示需平衡执行与忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11398 2026-05-13 cs.AI cs.CL 62%

AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment

AcuityBench:评估语言模型对医疗紧急情况识别和不确定性对齐

Robin Linzmayer, Georgianna Lin, Di Coneybeare, Jason Chu, Trudi Cloyd, Manish Garg, Miles Gordon, Elizabeth Hartofilis, Benjamin Hong, Ashraf Hussain, Eugene Y. Kim, Oluchi Iheagwara King, Ross McCormack, Erica Olsen, John K. Riggins, Mustafa N. Rasheed, Dana L. Sacco, Vinay Saggar, Osman R. Sayan, Amit Shembekar, Janice Shin-Kim, Wendy W. Sun, Bernard P. Chang, David Kessler, Noémie Elhadad

机构 * Department of Computer Science, Columbia University, New York, NY, USA(计算机科学系,哥伦比亚大学,纽约,纽约州,美国) Department of Biomedical Informatics, Columbia University, New York, NY, USA(生物医学信息学系,哥伦比亚大学,纽约,纽约州,美国) Department of Emergency Medicine, Columbia University Irving Medical Center, New York, NY, USA(急诊医学系,哥伦比亚大学伊文思医疗中心,纽约,纽约州,美国)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 AcuityBench通过统一框架评估语言模型对医疗紧急程度的识别能力,包含914个案例,涵盖明确和模糊情况,揭示模型在不同任务格式下的表现差异及不确定性处理问题。

Comments 41 pages, 5 figures. Preprint under review for the Track on Evaluations and Datasets at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08902 2026-05-13 cs.LG cs.AI 62%

Intention-Conditioned Flow Occupancy Models

意图条件流占用模型

Chongyi Zheng, Seohong Park, Sergey Levine, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出意图条件流占用模型(InFOM),通过引入用户意图的隐变量,提升模型对长期依赖的建模能力,在36个状态基和4个图像基基准任务中实现回报提升1.8倍和成功率提升36%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10876 2026-05-12 cs.LG cs.AI q-bio.QM 62%

AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents

AssayBench: 一个基于实验层面的虚拟细胞基准,用于LLMs和代理

Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia

机构 * Genentech(基因泰克)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 AssayBench通过1920个公开CRISPR实验构建,用于评估LLMs和代理在预测表型筛选中的性能,引入调整后的nDCG指标,显示通用LLMs在任务中表现优于生物专用模型。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10529 2026-05-12 cs.AI cs.LG 62%

PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs

PrimeKG-CL:一个在演进生物医学知识图谱上的持续图学习基准

Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Xingtong Yu, Jiaxing Huang, Renqiang Luo, Xikun Zhang

机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学) School of Computing and Information Systems(计算与信息系) The University of Melbourne(墨尔本大学) College of Computer Science and Technology(计算机科学与技术学院) School of Computing Technologies(计算技术学院) Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) Department of Systems Engineering and Engineering Management(系统工程与工程管理系) The Chinese University of Hong Kong(香港中文大学) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PrimeKG-CL基准,基于九个权威生物医学数据库构建,包含时间快照、任务和多模态特征,评估六种持续学习策略在不同解码器上的性能,发现解码器选择和策略交互显著,仅DistMult能区分持久与过时知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 62%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09272 2026-05-12 cs.AI cs.CL cs.CV 62%

Towards Conversational Medical AI with Eyes, Ears and a Voice

面向有眼睛、耳朵和声音的对话式医疗AI

Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AI co-clinician系统,利用音频视频数据实现实时临床决策,通过TelePACES评估标准显示其在管理计划和诊断差异方面接近医生,但在体格检查和疾病特异性推理上仍有不足。

Comments Video examples are available on Youtube: https://youtu.be/y5Vaa_SN1t0, https://youtu.be/dC4icb75vLQ, and https://youtu.be/E7iEvWo-E6c

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09228 2026-05-12 cs.LG cs.AI 62%

ProactBench: Beyond What The User Asked For

ProactBench: 超出用户所要求的

Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola

机构 * Boson AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 ProactBench研究对话主动性,通过三个阶段分解能力,设计代理对抗偏见,验证不同模型在恢复阶段的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08462 2026-05-12 cs.CL cs.AI 62%

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan

机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。

Comments Presented at the ROMCIR Workshop at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06334 2026-05-08 cs.CL cs.LG cs.LO 62%

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

MANTRA: 为使用工具的LLM代理合成经过SMT验证的合规性基准

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 MANTRA通过自动合成可机检验的合规性基准,解决LLM代理在复杂手册下的合规性验证问题,支持任意领域和长流程手册,并提供可调节的任务复杂度,生成285个任务的基准套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06066 2026-05-08 cs.LG cs.AI 62%

Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark

因果强化学习在复杂卡牌游戏中的应用:《魔法:英雄冒险》基准测试

Cristiano da Costa Cunha, Ajmal Mian, Tim French, Wei Liu

机构 * Department of Computer Science and Software Engineering, University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MTG-Causal-RL基准测试,通过Magic: The Gathering游戏中的复杂环境,结合因果结构和掩码动作空间,评估因果信用分配、跨 archetype 转移和策略可审计性等核心问题。

Comments 21 pages, 8 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01555 2026-05-05 cs.CL cs.AI cs.HC 62%

Automated Interpretability and Feature Discovery in Language Models with Agents

在语言模型中通过代理实现自动化可解释性和特征发现

Arnau Marin-Llobet, Javier Ferrando

机构 * Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个自主多代理框架,用于自动化大型语言模型的内部特征发现与解释,通过两个耦合循环提升解释精度和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 62%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02945 2026-05-05 cs.LG cs.AI 62%

Ergodic Risk Measures: Towards a Risk-Aware Foundation for Continual Reinforcement Learning

遍历风险度量:面向持续强化学习的风险感知基础

Juan Sebastian Rojas, Chi-Guhn Lee

机构 * University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出遍历风险度量理论,用于持续强化学习,解决传统风险中性方法与持续学习不兼容的问题,通过新理论提升持续学习的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15658 2026-05-05 cs.CL cs.AI cs.IR 62%

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

SurGE:科学调查生成的基准和评估框架

Weihang Su, Anzhe Xie, Qingyao Ai, Jianming Long, Xuanyi Chen, Jiaxin Mao, Ziyi Ye, Yiqun Liu

机构 * Tsinghua University(清华大学) Quan Cheng Laboratory(泉城实验室) Renmin University of China(中国人民大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 为科学调查生成任务设计了SurGE基准和评估框架,通过测试实例和学术文献库评估生成质量,揭示LLM在该任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14201 2026-05-04 cs.CR cs.AI cs.CL 62%

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

ExCyTIn-Bench:评估LLM代理在网络安全调查中的表现

Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Security AI Research(微软安全AI研究) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 ExCyTIn-Bench是首个评估LLM代理在网络安全调查任务中的基准,通过从调查图中生成的安全问题进行测试。该基准利用Azure租户中的SQL环境和Microsoft Sentinel日志构建威胁调查图,并生成问题以评估LLM代理的能力。

Comments Accepted By ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27673 2026-05-01 cs.AI cs.CY cs.HC cs.LG cs.SI 62%

The TEA Nets framework combines AI and cognitive network science to model targets, events and actors in text

TEA Nets框架结合人工智能与认知网络科学,用于建模文本中的目标、事件和主体

Sebastiano Franchini, Alexis Carrillo, Edoardo Sebastiano De Duro, Riccardo Improta, Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, Department of Psychology and Cognitive Science, University of Trento(CogNosco实验室,心理学与认知科学系,特伦托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 TEA Nets框架通过认知网络科学和人工智能提取文本中的主体、事件和目标,展示了在阴谋文本和LLM生成文本中进行可解释情绪检测、语义框架分析和语言研究的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26382 2026-04-30 cs.CL cs.AI cs.IR 62%

Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI

复杂多模态文档处理流水线评估:面向企业AI的统一评估框架

Saurabh K. Singh, Sachin Raj

机构 * Oracle(Oracle公司) Independent(独立)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出EnterpriseDocBench评估框架,评估企业文档AI流水线的各阶段性能,发现混合检索优于BM25,但生成质量不足,揭示了各阶段间弱相关性及实际部署中准确性与完整性之间的差距。

Comments 16 pages, 4 tables. Code, metrics, and pilot data to be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14858 2026-04-30 cs.AI cs.SE 62%

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex

轨迹安全评估与诊断的基准测试:OpenClaw和Codex中的ATBench-Claw和ATBench-Codex

Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出ATBench-Claw和ATBench-Codex,用于评估和诊断OpenClaw和Codex环境中的轨迹安全,通过定制安全分类法实现基准测试的可扩展性。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24700 2026-04-28 cs.CL cs.AI 62%

Green Shielding: A User-Centric Approach Towards Trustworthy AI

绿色防护:面向可信AI的用户导向方法

Aaron J. Li, Nicolas Sanchez, Hao Huang, Ruijiang Dong, Jaskaran Bains, Katrin Jaradeh, Zhen Xiang, Bo Li, Feng Liu, Aaron Kornblith, Bin Yu

机构 * University of California, Berkeley(加州大学伯克利分校) University of Melbourne(墨尔本大学) University of California, San Francisco(加州大学旧金山分校) University of Georgia(佐治亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Green Shielding方法,通过分析用户输入变化对模型行为的影响,为可信AI部署提供证据支持的指导。通过医疗诊断基准测试,展示了交互选择如何系统性地影响模型输出属性,支持高风险领域更安全的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24645 2026-04-28 cs.CL cs.AI 62%

K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology

K-MetBench:一个多维基准,用于细粒度评估气象学中的专家推理、局部性和多模态能力

Soyeon Kim, Cheongwoong Kang, Myeongjin Lee, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) INEEJI Kongju National University(康久国立大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出K-MetBench,一个基于韩国资格考试的多维基准,揭示了专家推理、逻辑有效性、韩国地理文化理解及领域分析四个维度的差距,发现韩国模型在本地情境中优于大模型。

Comments 39 pages, 32 figures, 14 tables, including appendices. Accepted to Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏