arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2604.26956 2026-05-01 cs.CY cs.AI cs.HC 70%

Can AI be a moral victim? The role of moral patiency and ownership perceptions in ethical judgments of using AI-generated content

AI能否成为道德受害者?道德耐心和所有权感知在使用AI生成内容的伦理判断中的作用

Hyesun Choung, Soojong Kim

机构 * Purdue University(普渡大学) University of California, Davis(加州大学戴维斯分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究探讨了人们在评估AI生成内容再利用时的道德判断,发现AI生成内容被判定为不道德和抄袭的可能性较低,这归因于较低的道德耐心感知和更高的所有权归属。

Comments Honourable Mention Award, ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23781 2026-04-28 cs.CV cs.SE 70%

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

ClawMark:多轮、多日、多模态同事代理的活体世界基准

Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

机构 * ClawMark Team(ClawMark团队)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.SE

AI总结 ClawMark基准通过多轮多日任务和状态化沙盒环境评估同事代理在动态环境中的表现,包含100个专业场景任务,测试七种前沿代理系统,揭示部分进展常见但完整流程完成罕见。

Comments github repo: https://github.com/evolvent-ai/ClawMark

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23539 2026-04-28 cs.AI 70%

MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation

MetaGAI:一个大规模且高质量的生成AI模型和数据卡生成基准

Haoxuan Zhang, Ruochi Li, Yang Zhang, Zhenni Liang, Junhua Ding, Ting Xiao, Haihua Chen

机构 * University of North Texas(北德克萨斯大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出MetaGAI基准,通过语义三角化构建2541个验证文档三元组,采用多智能体框架进行评估,揭示稀疏MoE架构在成本与质量效率上的优势,为大规模评估生成模型和数据卡方法提供基础测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04855 2026-04-27 cs.CL 70%

HACHIMI: Scalable and Controllable Student Persona Generation via Orchestrated Agents

HACHIMI: 通过协调代理实现可扩展和可控的学生人设生成

Yilin Jiang, Fei Tan, Xuanyu Yin, Jing Leng, Aimin Zhou

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 HACHIMI通过协调代理框架生成理论对齐且分布可控的学生人设,生成100万个人设用于1-12年级,验证了其在教育理论和人口分布上的有效性。

Comments 46 pages, 7 figures, accepted by ACL 2026. The dataset is available at https://huggingface.co/datasets/sii-research/HACHIMI-1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20382 2026-04-23 cs.CL 70%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 49 pages, 46 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20151 2026-04-23 cs.RO cs.LG 70%

Toward Safe Autonomous Robotic Endovascular Interventions using World Models

迈向安全的自主机器人内血管干预的世模型

Harry Robertshaw, Nikola Fischer, Han-Ru Wu, Andrea Walker Perez, Weiyuan Deng, Benjamin Jackson, Christos Bergeles, Alejandro Granados, Thomas C Booth

机构 * Surgical & Interventional Engineering, School of Biomedical Engineering & Imaging Sciences, King’s College London(外科与介入工程系,生物医学工程与成像科学学院,伦敦国王学院) Department of Radiology, National Taiwan University Hospital(放射科,台湾大学医院) Department of Neuroradiology, King’s College Hospital(神经放射科,伦敦国王医院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出基于世模型的框架,利用TD-MPC2方法在内血管导航中实现自主机械取栓,通过仿真和体外实验验证其在安全性和泛化性上的优势。

Comments This manuscript is a preprint and has been submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19633 2026-04-22 cs.AI cs.CE 70%

Time Series Augmented Generation for Financial Applications

时间序列增强生成用于金融应用

Anton Kolonin, Alexey Glushchenko, Evgeny Bochkov, Abhishek Saxena

机构 * SingularityNET Foundation(SingularityNET基金会)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出了一种新的评估方法和基准,用于衡量LLM在金融时间序列分析中的推理能力,通过大规模实证研究验证了工具增强范式的有效性。

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18660 2026-04-22 cs.CR cs.AI 70%

Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

评估LLM导师对对抗性学生攻击的答案泄露鲁棒性

Jin Zhao, Marta Knežević, Tanja Käser

机构 * EPFL(瑞士联邦理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文研究了学生对抗性攻击下LLM导师的答案泄露鲁棒性,评估了多种模型在对抗攻击下的表现,并提出标准化基准和防御策略。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28166 2026-04-21 cs.CR cs.AI 70%

Evaluating Privilege Usage of Agents with Real-World Tools

评估具有现实工具的代理的特权使用

Quan Zhang, Lianhang Fu, Lvsi Lian, Gwihwan Go, Yujue Wang, Chijin Zhou, Yu Jiang, Geguang Pu

机构 * Xinjiang University(新疆大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出GrantBox,一个用于评估代理特权使用的安全沙盒,通过集成真实工具和允许LLM代理调用真实特权,评估代理在提示注入攻击下的安全能力,发现LLM在面对复杂攻击时平均攻击成功率高达84.80%。

Comments Accepted to the FSE 2026 Ideas, Visions, and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05523 2026-04-21 cs.AI 70%

Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition

Market-Bench: 在经济与贸易竞争中评估大语言模型

Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出Market-Bench,通过经济贸易竞争评估大语言模型在经济相关任务中的能力,发现LLM在竞争中表现差异显著,只有少数能持续获利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05073 2026-04-21 cs.AI 70%

Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities

大语言模型代理中的不确定性量化:基础、新兴挑战与机遇

Changdae Oh, Seongheon Park, To Eun Kim, Jiatong Li, Wendi Li, Samuel Yeh, Xuefeng Du, Hamed Hassani, Paul Bogdan, Dawn Song, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型代理中不确定性量化的基础、挑战及未来方向,提出新的框架并分析了现实场景中的技术难题。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17143 2026-04-21 cs.LG 70%

SeekerGym: A Benchmark for Reliable Information Seeking

SeekerGym:一个评估可靠信息检索的基准

Remy Kim, Minseung Lee, Shuo Li, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学) Curation Labs Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 SeekerGym旨在评估AI代理检索信息的完整性,通过文档检索任务测试代理对信息完整性的量化能力,实验显示现有模型在Wikipedia和ML调研论文上分别检索出42.5%和29.2%的段落,仍有改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16353 2026-04-21 cs.IR cs.AI 70%

AgriIR: A Scalable Framework for Domain-Specific Knowledge Retrieval

AgriIR:一个可扩展的领域特定知识检索框架

Shuvam Banerji Seal, Aheli Poddar, Alok Mishra, Dwaipayan Roy

机构 * Indian Institute of Science Education Research, Kolkata, India Institute of Engineering \& Management, Kolkata, India , , , Contributed equally

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 AgriIR通过模块化设计实现领域特定知识检索,结合大语言模型与自适应检索器,确保在资源受限下提供可信答案,推动农业领域的AI应用。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10159 2026-04-21 cs.CL cs.DB cs.IR cs.MA 70%

ODUTQA-MDC: A Task for Open-Domain Underspecified Tabular QA with Multi-turn Dialogue-based Clarification

ODUTQA-MDC:一个面向开放领域未指定表格问答的任务

Zhensheng Wang, ZhanTeng Lin, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出ODUTQA-MDC任务及首个综合基准,包含大规模数据集、细粒度标注方案和动态澄清界面,提出MAIC-TQA框架以检测歧义、通过对话澄清并优化答案。

Comments This paper has been accepted by ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15972 2026-04-20 cs.CV cs.AI 70%

When Cultures Meet: Multicultural Text-to-Image Generation

当文化相遇:多文化文本到图像生成

Parth Bhalerao, Mounika Yalamarty, Brian Trinh, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出多文化文本到图像生成任务,构建首个评估基准,分析先进模型在多文化场景下的表现,提出MosAIG框架提升图像生成质量与文化准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15415 2026-04-20 cs.CR cs.AI 70%

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

HarmfulSkillBench: 你的代理如何被有害技能所利用?

Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文首次研究了代理生态系统中的有害技能,发现4.93%的技能具有潜在危害,并构建了HarmfulSkillBench基准,评估六个LLM在有害技能下的表现,发现预装技能显著降低拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14495 2026-04-17 cs.CE cs.AI cs.CR 70%

Decoupling Identity from Utility: Privacy-by-Design Frameworks for Financial Ecosystems

分离身份与效用:面向金融生态系统的设计隐私框架

Ifayoyinsola Ibikunle, Tyler Farnan, Senthil Kumar, Mayana Pereira

机构 * Capital One

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出通过差分隐私合成数据解决金融机构在最大化数据效用与缓解传统匿名化方法重新识别风险之间的矛盾,探讨了两种生成范式并展示了其在动态市场行为建模中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14254 2026-04-17 cs.AI cs.LO 70%

Formalizing Kantian Ethics: Formula of the Universal Law Logic (FULL)

规范康德伦理学:普遍律令逻辑(FULL)

Taylor Olson

机构 * Taylor Olson(塔勒尔·奥尔森)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种多排序量化模态逻辑FULL,用于规范康德伦理学,通过无需内置道德直觉的背景知识评估代理行为,提升AI代理的鲁棒性和自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07338 2026-04-17 cs.CL 70%

Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation

超越字面映射:非字面翻译评估的基准测试与改进

Yanzhi Tian, Cunxiang Wang, Zeming Liu, Heyan Huang, Wenbo Yu, Dawei Song, Jie Tang, Yuhang Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程组) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出RATE框架,通过反思核心代理动态调用专用子代理,提升非字面翻译评估的准确性,实验显示其在系统和段级相关性上比现有方法提高至少3.2分。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12162 2026-04-15 cs.CL 70%

AlphaEval: Evaluating Agents in Production

AlphaEval:生产环境中的代理评估

Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao Chi, Zisheng Chen, Kaishen Chen, Kun Wang, Qihua Xu, Fengyue Meng, Yuchen Ni, Jiajun Li, Jinxiu Liu, Danfeng Zhang, Jingru Zhao, Pengfei Liu

机构 * SII MiraclePlus SJTU(上海交通大学) GAIR HIT(哈尔滨工业大学) UCAS(中国科学技术大学) LangCore Jiqizhixin HunterAI CinoCore KuaFuAI POET

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 AlphaEval 是一个基于生产环境的评估基准,包含 94 个任务,涵盖六个职业领域,通过多种评估方法评估完整代理产品,提供可复现的构建框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11969 2026-04-15 cs.AI 70%

Narrative-Driven Paper-to-Slide Generation via ArcDeck

通过ArcDeck实现叙事驱动的论文到幻灯片生成

Tarik Can Ozden, Sachidanand VS, Furkan Horoz, Ozgur Kara, Junho Kim, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Middle East Technical University(中东技术大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ArcDeck框架,通过结构化叙事重建任务提升论文到幻灯片生成的逻辑连贯性,引入ArcBench基准测试,实验表明显式话语建模与角色特定代理协调显著提升生成演示的叙事流畅度和逻辑性。

Comments Project webpage: https://arcdeck.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17012 2026-04-14 cs.CV cs.AI 70%

SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

SpatialScore:迈向空间智能的综合评估

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。

Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11072 2026-04-14 cs.AI 70%

Hodoscope: Unsupervised Monitoring for AI Misbehaviors

Hodoscope:无监督监控AI误行

Ziqian Zhong, Shashwat Saxena, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Hodoscope,通过无监督方法发现AI代理的异常行为,减少人工审查工作量,并提升LLM判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09634 2026-04-14 cs.CY cs.AI 70%

From Understanding to Creation: A Prerequisite-Free AI Literacy Course with Technical Depth Across Majors

从理解到创造:一个无先修要求的AI素养课程,跨专业技术深度

Amarda Shehu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文介绍了一门无先修要求的AI素养课程,通过五个机制提升学生对AI系统的理解、使用、评估和构建能力,课程设计兼顾技术深度与跨专业适用性。

Comments 37 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07720 2026-04-13 cs.AI 70%

Towards Knowledgeable Deep Research: Framework and Benchmark

走向知识导向的深度研究:框架与基准

Wenxuan Liu, Zixuan Li, Long Bai, Chunmao Zhang, Fenghui Zhang, Zhuo Chen, Wei Li, Yuxin Zuo, Fei Wang, Bingbing Xu, Xuhui Jiang, Jin Zhang, Xiaolong Jin, Jiafeng Guo, Tat-Seng Chua, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08226 2026-04-10 cs.AI cs.HC cs.SY eess.SY 70%

Grounding Clinical AI Competency in Human Cognition Through the Clinical World Model and Skill-Mix Framework

通过临床世界模型和技能混合框架在人类认知中奠定临床AI能力

Seyed Amir Ahmad Safavi-Naini, Elahe Meftah, Josh Mohess, Pooya Mohammadi Kazaj, Georgios Siontis, Zahra Atf, Peter R. Lewis, Mauricio Reyes, Girish Nadkarni, Roland Wiest, Stephan Windecker, Christoph Grani, Ali Soroush, Isaac Shiri

机构 * Department of Cardiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院心脏病学系,伯尔尼大学) Department of Digital Medicine, Bern University Hospital, University of Bern(伯尔尼大学医院数字医学系,伯尔尼大学) Division of Data-Driven and Digital Medicine (D3M), Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院数据驱动与数字医学部) Clinical Research Development Center, Amir Oncology Teaching Hospital, Shiraz University of Medical Sciences(设拉子医科大学阿米尔肿瘤教学医院临床研究发展中心) Graduate School for Cellular and Biomedical Sciences, University of Bern(伯尔尼大学细胞与生物医学研究生院) Faculty of Business and Information Technology, Ontario Tech University(安大略理工大学商业与信息技术学院) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(伯尔尼大学医院放射肿瘤学系,伯尔尼大学) ARTORG Center for Biomedical Engineering Research, University of Bern(伯尔尼大学ARTORG生物医学工程研究中心) The Charles Bronfman Institute of Personalised Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院查尔斯·布朗夫曼个性化医学研究所) University Institute of Diagnostic and Interventional Neuroradiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院诊断与介入神经放射学大学研究所,伯尔尼大学) Translational Imaging Center (TIC), Swiss Institute for Translational and Entrepreneurial Medicine(瑞士转化与创业医学研究所转化影像中心) Henry D. Janowitz Division of Gastroenterology, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院亨利·D·雅诺维茨消化内科)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出临床世界模型和技能混合框架,通过八维定义临床能力空间,为AI在医疗场景中的能力评估和验证提供结构化方法。

Comments Code, data (Clinical AI Skill-Mix dimension specifications), and an exploratory dashboard are available at https://github.com/Sdamirsa/Clinical-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07535 2026-04-10 cs.AI 70%

Trust the AI, Doubt Yourself: The Effect of Urgency on Self-Confidence in Human-AI Interaction

信任人工智能,怀疑自己:紧迫感对人机交互中自信心的影响

Baran Shajari, Xiaoran Liu, Kyanna Dagenais, Istvan David

机构 * McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究探讨了紧迫感对人机交互中人类自信心的影响,发现尽管紧迫感不影响对AI的信任,但可能损害人类的自信心和自我效能感,进而影响性能和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07429 2026-04-10 cs.CV cs.AI cs.HC 70%

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

GameWorld: 向标准化和可验证的多模态游戏代理评估迈进

Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05398 2026-04-08 math.OC cs.LG 70%

An Actor-Critic Framework for Continuous-Time Jump-Diffusion Controls with Normalizing Flows

一个用于连续时间跳跃扩散控制的Actor-Critic框架

Liya Guo, Ruimeng Hu, Xu Yang, Yi Zhu

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Department of Mathematics, Tsinghua University(清华大学数学系) Department of Mathematics, University of California, Santa Barbara(加州大学圣塔芭芭拉分校数学系) Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣塔芭芭拉分校统计与应用概率系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京雁栖湖应用数学研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出一个无网格求解器,用于解决熵正则化控制问题和具有跳跃的随机博弈,通过时间非齐性小q函数和适当的职业测度,结合条件归一化流参数化Actor,实现灵活的非高斯策略,并在多个金融和博弈场景中验证了方法的有效性。

Comments 29 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05364 2026-04-08 cs.AI 70%

TFRBench: A Reasoning Benchmark for Evaluating Forecasting Systems

TFRBench:用于评估预测系统推理能力的基准测试

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Yiwen Song, Long T. Le, Qiang Cheng, Chun-Liang Li, Hamid Palangi, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TFRBench通过多智能体框架评估预测系统推理能力,提升预测准确性,验证了其在时间序列预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏