arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-02 至 2026-06-02 共收录 425 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 74 篇

2606.02302 2026-06-02 cs.CR cs.AI 83%

SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

SeClaw: 面向自主代理评估的规范驱动安全任务合成

Hao Cheng, Changtao Miao, Tianle Song, Yin Wu, He Liu, Erjia Xiao, Junchi Chen, Xiaoyu Shi, Yichi Wang, Jing Yang, Taowen Wang, Jinhao Duan, Mengshu Sun, Peiyan Dong, Xuan Shen, Yang Cao, Renjing Xu, Kaidi Xu, Jindong Gu, Bo Zhang, Jize Zhang, Chenhao Lin, Philip Torr, Chao Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Xi’an Jiaotong University(西安交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) City University of Hong Kong(香港城市大学) Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) Massachusetts Institute of Technology(麻省理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Beijing University of Technology(北京理工大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出SeClaw框架,通过规范驱动的安全任务合成与基于执行的安全评估,实现对自主LLM代理在状态化环境中的安全风险的可扩展、可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02109 2026-06-02 cs.AI 83%

BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning

BADGER:桥接生成式企业推理的自主与确定性评估

Shannon Serrao, Soumitra Chatterjee, Dorina Strori, Abhishek Sharma, Nathan Miller

机构 * Merkle Analytics

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出BADGER框架,统一文本到SQL评估与自主行为评估,通过混合执行准确率指标(Hybrid-EX)和自主评估套件,在工业查询上超越现有方法。

Comments 30 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00925 2026-06-02 cs.CR cs.AI 83%

Benchmarking Security Risk Detection and Verification in Open Agentic Skill Ecosystems

开放智能体技能生态系统中的安全风险检测与验证基准测试

Ismail Hossain, Sai Puppala, Zhuoran Lu, Sajedul Talukder, Nan Jiang

机构 * University of Texas at El Paso(德克萨斯理工大学) Southern Illinois University-Carbondale(南方伊利诺伊大学卡本代尔分校) Purdue University(普渡大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出SkillVetBench,一个两阶段安全审查基准,通过语义审查和沙箱执行检测与验证开放智能体技能生态系统中的恶意技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00067 2026-06-02 cs.SI cs.MA 82%

When Agents Talk: Discourse, Manipulation, and Risk in an Agentic Social Network

当智能体对话:一个智能体社交网络中的话语、操纵与风险

10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Nguyen, Brooke Perreault, David Pham, Charlie Plumb, Olivia Quill, Matthew Swain, Grace Wang, Adam Warren, Corie Wieland, Zachary Yahn

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract)

AI总结 通过分析一个Reddit风格的AI智能体社交平台上的22.8万条帖子,结合语义聚类和LLM辅助有害内容分类,发现18.28%的帖子包含有害内容,并识别出74类恶意行为,包括凭证窃取、主机执行指令等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18008 2026-06-02 cs.LG cs.AI cs.CL 82%

Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework

LLM 是否准备好进行神经集成机制建模?一个基准测试与智能体框架

Zihan Guan, Rituparna Datta, Mengxuan Hu, Shunshun Liu, Aiying Zhang, Prasanna Balachandran, Sheng Li, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出神经集成机制建模(NIMM)基准测试,评估大语言模型在三个科学领域构建神经集成机制模型的能力,并设计树引导的智能体框架 NIMMGen,通过分支级搜索和原子模型细化显著提升搜索稳定性和解质量。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02494 2026-06-02 cs.SE cs.AI 82%

Monitoring Agentic Systems Before They're Reliable

在代理系统可靠之前对其进行监控

Marisa Ferrara Boston, Glen Hanson, Effi Georgala, JD Hudgens, Heather Frase

机构 * Reins AI USA(Reins AI美国公司) Veraitech USA(Veraitech美国公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 针对生产环境中代理系统因结构缺陷主导故障的问题,提出一种基于方差信号的三维度三范围监控与分类方法,并通过合成测试验证其有效性。

Comments 9 pages, 2 figures, 3 tables. Accepted to the Workshop on Agentic Software Engineering (AgenticSE), co-located with ACM CAIS 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00987 2026-06-02 cs.CV cs.AI 81%

An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation

多时相指代分割的开源基准与基线

Bingyu Li, Da Zhang, Tao Huo, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) China Telecom(中国电信) School of Artificial Intelligence, Optics and Electronics (iOPEN)(人工智能、光学与电子学院) Northwestern Polytechnical University(西北工业大学)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI

AI总结 提出多时相指代分割任务,通过自动化数据构建管道CRAFT-Agent生成首个基准MTRefSeg-21K,并设计两阶段训练的变化感知LVLM框架MTRefSeg-R1,实现优于现有基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15229 2026-06-02 cs.SE cs.AI 81%

PBT-Bench: Benchmarking AI Agents on Property-Based Testing

PBT-Bench:基于属性测试的AI智能体基准

Lucas Jing, Xinqi Wang, Liao Zhang, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) Beneficial AI Foundation(有益人工智能基金会)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 提出PBT-Bench基准,包含100个基于属性测试的问题,用于评估AI智能体从文档中推导语义不变量并生成输入策略的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10958 2026-06-02 cs.CV 80%

WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World

WorldLens:真实世界中驾驶世界模型的全光谱评估

Ao Liang, Lingdong Kong, Tianyi Yan, Hongsi Liu, Wesley Yang, Ziqi Huang, Wei Yin, Jialong Zuo, Yixuan Hu, Dekai Zhu, Dongyue Lu, Youquan Liu, Guangfeng Jiang, Linfeng Li, Xiangtai Li, Long Zhuo, Lai Xing Ng, Benoit R. Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, Ziwei Liu

机构 * WorldBench Team(WorldBench团队) Equal Contributions Project Lead(同等贡献项目负责人) Project Lead(项目负责人) Corresponding Author(通讯作者)

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 提出WorldLens基准,从生成、重建、动作跟随、下游任务和人类偏好五个方面评估生成世界模型在视觉真实性、几何一致性、物理合理性和功能可靠性上的表现,并构建WorldLens-26K数据集和WorldLens-Agent评估模型以实现可扩展的可解释评分。

Comments CVPR 2026 Oral Presentation; 80 pages, 37 figures, 29 tables; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01936 2026-06-02 cs.CL 79%

What to Format and How: A Benchmark and Workflow Approach for Document Formatting

格式化什么以及如何格式化:文档格式化的基准与工作流方法

Shihao Rao, Liang Li, Jiapeng Liu, Tong Lin, Bing Li, Xiyan Gao, Peng Fu, Jing Huang, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 Agent评测 :workflow(title,abstract);分类 cs.CL

AI总结 针对内容感知的文档格式化任务,提出基准DocFormBench和工作流方法DocFormFlow,通过解耦目标定位与修改执行,在提升准确率的同时降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01230 2026-06-02 cs.AI 79%

HomeFlow: A Data Flywheel for Smart Home Agent Training with Verifiable Simulation

HomeFlow: 面向智能家居智能体训练的可验证数据飞轮

Yi Gu, Huacan Wang, Shuo Zhang, Yuqing Hou, Lei Xue, Weipeng Ming, Chen Liu, Fangzhou Yu, Kuan Li, Ronghao Chen, Sen Hu, Xiaofeng Mou, Yi Xu

机构 * Midea Group(美的集团) Beijing University of Posts and Telecommunications(北京邮电大学) Donghua University(东华大学) Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出HomeFlow,一种通过统一仿真环境HomeEnv、程序化家居生成HomeMaker、蓝图编译用户意图、MCTS-Flow合成可验证轨迹,并结合监督微调和逐步RLVE优化智能体的可验证数据飞轮方法,在SmartHome-Bench上达到84.60%和87.03%的任务成功率,其中8B模型超越GPT-5.5 1.23个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09549 2026-06-02 cs.IR cs.AI 79%

Beyond Offline A/B Testing: Context-Aware Agent Simulation for Recommender System Evaluation

超越离线A/B测试:面向推荐系统评估的上下文感知智能体模拟

Nicolas Bougie, Gian Maria Marconi, Xiaotong Ye, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对推荐系统评估中离线指标与在线性能脱节的问题,提出基于大语言模型的上下文感知智能体框架ContextSim,通过生活模拟模块生成时间、地点和需求等上下文场景,并保持智能体行为一致,使模拟交互更贴近真实用户行为,且优化后的推荐系统参数能提升实际参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06841 2026-06-02 cs.AI 79%

From Features to Actions: Explainability in Traditional and Agentic AI Systems

从特征到行动:传统与智能体AI系统中的可解释性

Sindhuja Chaduvula, Jessee Ho, Kina Kim, Aravind Narayanan, Ahmed Y. Radwan, Mahshid Alinoori, Muskan Garg, Dhanesh Ramachandram, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) Independent Researcher(独立研究者) Mayo Clinic(梅奥诊所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文比较了基于归因的解释与基于轨迹的诊断在静态和智能体设置中的效果,发现归因方法无法可靠诊断智能体轨迹中的执行级故障,而轨迹级可解释性更能定位行为故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00053 2026-06-02 cs.RO 78%

VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis

VLAMotor: 通过基于智能体的数据合成实现视觉-语言-动作模型的测试引导增强

Zeqin Liao, Peifan Ren, Zixu Gao, Hongyu Gong, Lianyu Hu, Wenbing Tang, Yuhong Nan, Zibin Zheng, Yang Liu

机构 * School of computing and data science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) School of Software Engineering, Sun Yat-sen University(软件工程学院,中山大学) GuangDong Engineering Technology Research Center of Blockchain, China(区块链工程技术研发中心,中国) Northwest A&F University(西北农林科技大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出VLAMotor框架,通过距离感知测试暴露失败案例,并利用基于智能体的数据合成生成成功轨迹微调VLA模型,显著提升模型在仿真和真实环境中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05256 2026-06-02 cs.SI cs.DM cs.MA q-bio.QM 78%

Social Network Analysis and Validation of an Agent-Based Model

基于智能体的模型的社会网络分析与验证

Karleigh Pine, Joel Klipfel, Jared Bennett, Nathaniel Bade, Christian Manasseh

专题命中 Agent评测 :agent(title,abstract)

AI总结 利用多种网络比较方法(包括基于热核渐近的新型图伪度量)跟踪基于智能体模型中的网络变化,并利用网络科学中的真实网络特征在缺乏经验数据时验证模型。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22999 2026-06-02 cs.CL 77%

PaperVoyager : Building Interactive Web with Visual Language Models

PaperVoyager:利用视觉语言模型构建交互式网页

Dasen Dai, Biao Wu, Meng Fang, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS(UTS大学) University of Liverpool(利物浦大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);tool use(abstract);分类 cs.CL

AI总结 提出PaperVoyager框架,将研究论文自动转化为可执行的交互式网页系统,通过显式建模机制和交互逻辑,显著提升生成系统的质量。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00017 2026-06-02 cs.AI cs.CL cs.MA 73%

MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution

MindGames Arena 泛化赛道:具有延迟每步奖励归因的 In2AI 解决方案

Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov

机构 * iMak AI Lab(iMak人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 提出延迟每步奖励归因方法,结合资格门控、异步rollout生成和课程对手采样,实现多智能体环境中稳定高效的强化学习训练,并在NeurIPS 2025的MindGames Arena基准测试中取得领先。

Comments 18 pages, 2 figures, 9 tables. Technical report. First place in both Open and Efficient tracks of MindGames Arena Generalization Track at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15259 2026-06-02 cs.CY cs.AI cs.LG 73%

Knowing Isn't Understanding: Re-grounding Generative Proactivity with Epistemic and Behavioral Insight

知道不等于理解:用认知与行为洞察重新奠定生成式主动性

Kirandeep Kaur, Xingda Lyu, Chirag Shah

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 针对用户无法明确表达需求时的认知不完整问题,提出生成式主动性需要基于认知和行为双重约束来设计负责任的主动代理。

Comments 43 rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02470 2026-06-02 cs.AI 70%

MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation

MCP-Persona:通过环境模拟在真实个人应用上基准测试LLM智能体

Wenhao Wang, Peizhi Niu, Gongyi Zou, Xiyuan Yang, Jingxing Wang, Haoting Shi, Yaxin Du, Jingyi Chai, Xianghe Pang, Shuo Tang, Yanfeng Wang, Siheng Chen

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 针对现有基准忽略个人社交应用中工具与个人账户或本地数据库交互的挑战,提出MCP-Persona基准,通过模拟真实个性化MCP工具评估LLM智能体性能,实验表明现有智能体在个性化工具使用上存在显著困难。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01886 2026-06-02 cs.AI cs.CE 70%

Absorbing Complexity: An Interaction-Native Knowledge Harness for Financial LLM Agents

吸收复杂性:面向金融LLM代理的交互原生知识驾驭系统

Ailiya Borjigin, Igor Stadnyk, Ben Bilski, Maksym Chikita, Dmytro Kyrylenko, Sofiia Pidturkina, Julia Stadnyk

机构 * True Trading Inc4.net

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出交互原生知识驾驭(InKH)架构,通过被动知识注入、时序图记忆和过期失效机制,将复杂性吸收到系统中,在金融LLM代理任务中显著降低延迟、令牌成本和过时知识使用,同时提升任务质量和可追溯性。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01686 2026-06-02 cs.SD cs.AI 70%

HAIM: Human-AI Music Datasets for AI Music Production Tracking Benchmark

HAIM: 用于AI音乐制作跟踪基准的人机音乐数据集

Seonghyeon Go, Yumin Kim

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 针对当前AI音乐检测局限于二元分类的不足,提出HAIM数据集,通过多阶段标签定义“AI音乐跟踪”任务,评估现有检测器缺陷,推动向细粒度结构化评估转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25799 2026-06-02 cs.CL 70%

LISTEN to Your Preferences: An LLM Framework for Multi-Objective Selection

LISTEN 你的偏好:面向多目标选择的LLM框架

Adam S. Jovine, Tinghan Ye, Francis Bahk, Jingjing Wang, Matthew Ford, David B. Shmoys, Peter I. Frazier

机构 * Cornell University(康奈尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出LISTEN框架,利用LLM作为决策代理,通过迭代优化内部偏好模型(LISTEN-U参数法或LISTEN-T非参数法)从自然语言中学习用户隐含偏好,实现多目标选择。

Comments Accepted at IJCAI-ECAI 2026 (the 35th International Joint Conference on Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07061 2026-06-02 cs.SD cs.AI cs.CV cs.MM 70%

Do Joint Audio-Video Generation Models Understand Physics?

联合音视频生成模型是否理解物理?

Zijun Cui, Xiulong Liu, Hao Fang, Mingwei Xu, Jiageng Liu, Zexin Xu, Weiguo Pian, Shijian Deng, Feiyu Du, Chenming Ge, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。

Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02314 2026-06-02 cs.NI 67%

Discovering Agents for Discovery: The Case for DNS

发现智能体:DNS 的案例

Ramachandra Rao Seethiraju, Sameer Thakar, Karthik Shyamsunder, Eric Osterweil

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出利用 DNS 作为 AI 智能体发现的基础设施,通过评估导航完整性、查找复杂性和事务性能,证明 DNS 能够以低延迟和低数据量支持大规模智能体发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01311 2026-06-02 cs.CL cs.AI cs.LG cs.MA 67%

SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories

SkillAdaptor:基于轨迹的LLM智能体自适应技能

Zhuoyun Yu, Xin Xie, Wuguannan Yao, Chenxi Wang, Lei Liang, Xiang Qi, Shumin Deng

机构 * Zhejiang University(浙江大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SkillAdaptor,一种无训练的步骤级技能自适应框架,通过显式故障归因和针对性更新,提升LLM智能体在长程交互任务中的表现。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00198 2026-06-02 cs.LG cs.AI cs.CL 67%

BAGEN: Are LLM Agents Budget-Aware?

BAGEN:LLM 智能体是否具有预算意识?

Yuxiang Lin, Zihan Wang, Mengyang Liu, Yuxuan Shan, Longju Bai, Junyao Zhang, Xing Jin, Boshan Chen, Jinyan Su, Xingyao Wang, Jiaxin Pei, Manling Li

机构 * Northwestern University(西北大学) O2 Lab(O2实验室) Independent(独立) University of Michigan(密歇根大学) Cornell(康奈尔大学) All Hands AI Stanford(斯坦福大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出预算感知智能体(BAGEN)概念,将预算作为主动控制信号而非被动成本指标,通过渐进区间估计方法预测剩余预算上下界,并在四个环境和五个前沿模型上发现强模型不一定具有强预算意识、模型过度乐观等失败模式,早期停止可节省 28-64% 令牌,但精确区间校准仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03554 2026-06-02 cs.LG cs.AI cs.CE cs.CL 67%

When Single Answer Is Not Enough: Rethinking Single-Step Retrosynthesis Benchmarks for LLMs

当单一答案不够时:重新思考面向大语言模型的单步逆合成基准

Bogdan Zagribelnyy, Ivan Ilin, Maksim Kuznetsov, Nikita Bondarev, Mathieu Reymond, Roman Schutski, Thomas MacDougall, Rim Shayakhmetov, Zulfat Miftakhutdinov, Mikolaj Mizera, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * DeepMind, London, UK(伦敦英国深度思维公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对现有逆合成基准依赖单一真实答案的局限,提出基于化学合理性度量ChemCensor的新评估框架,并构建数据集CREED训练模型以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02287 2026-06-02 cs.LG cs.AI 62%

CityTrajBench: A Unified Benchmark for City-Scale Vehicle Trajectory Generation

CityTrajBench: 城市尺度车辆轨迹生成的统一基准

Shibo Zhu, Xiaodan Shi, Dayin Chen, Yuntian Chen, Haoran Zhang, Tianhao Wu, Jinyue Yan

机构 * Department of Building Environment and Energy Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学建筑环境与能源工程系) Eastern Institute for Advanced Study, Eastern Institute of Technology, Ningbo, China(宁波东部先进研究所) International Centre of Urban Energy Nexus, The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学城市能源 nexus 中心) Department of Computer and Systems Sciences, Stockholm University, Sweden(斯德哥尔摩大学计算机与系统科学系) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology, Ningbo, China(浙江工业智能与数字孪生重点实验室) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究所) LocationMind Inc., Tokyo 101-0042, Japan(LocationMind公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 为解决轨迹生成方法因数据集、预处理、表示和评估指标不一致导致的比较困难,提出CityTrajBench统一基准框架,标准化数据处理、模型适配与多级评估,并在三个真实数据集上对比统计、VAE、GAN、扩散和流匹配模型,揭示不同模型在全局真实性、轨迹几何保真度等指标上的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02122 2026-06-02 cs.LG cs.AI 62%

STABLEVAL: Disagreement-Aware and Stable Evaluation of AI Systems

STABLEVAL: 面向AI系统的分歧感知与稳定评估

Akash Bonagiri, Gerard Janno Anderias, Saee Patil, Angelina Lai, Devang Borkar, Gezheng Kang, Ishant Gandhi, Setareh Rafatirad, Houman Homayoun

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对多数投票法在标注者分歧下导致排名不稳定的问题,提出STABLEVAL框架,通过建模潜在正确性和标注者混淆模式,实现稳定且不确定性感知的系统评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00310 2026-06-02 cs.CV cs.AI cs.LG 62%

Beyond Visual Fidelity: Benchmarking Super-Resolution Models for Large-Scale Remote Sensing Imagery via Downstream Task Integration

超越视觉保真度:通过下游任务集成评估大规模遥感影像的超分辨率模型

Zhili Li, Kangyang Chai, Zhihao Wang, Xiaowei Jia, Yanhua Li, Gengchen Mai, Sergii Skakun, Dinesh Manocha, Yiqun Xie

机构 * University of Maryland(马里兰大学) University of Pittsburgh(匹兹堡大学) Worcester Polytechnic Institute(沃思利技术学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有超分辨率评估依赖PSNR/SSIM等保真度指标而忽略下游任务效用的问题,提出GeoSR-Bench基准数据集,集成土地覆盖分割、基础设施映射等下游任务,评估GAN、Transformer等9种SR模型在270种设置下的性能,发现保真度指标与任务性能弱相关甚至负相关。

Comments Under review at IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏