arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2603.22617 2026-03-25 cs.HC cs.AI 57%

Do Consumers Accept AIs as Moral Compliance Agents?

消费者是否将人工智能视为道德合规代理?

Greg Nyilasy, Abraham Ryan Ade Putra Hito, Jennifer Overbeck, Brock Bastian, Darren W. Dahl

机构 * Faculty of Business and Economics, University of Melbourne(商学院与经济学院,墨尔本大学) University of Melbourne(墨尔本大学) University of Melbourne, Parkville(墨尔本大学,帕克维尔)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨消费者是否接受人工智能作为道德合规代理,发现消费者更倾向于认可AI遵守既定道德规范,而非行使主观判断,这源于对AI无隐藏动机的推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22499 2026-03-25 cs.CR cs.LG 57%

OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection

OrgForge-IT:一种可验证的合成基准用于基于大语言模型的内部威胁检测

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出OrgForge-IT,一种可验证的合成基准,通过确定性模拟引擎和语言模型生成表面文本,确保跨 artifact 一致性。研究发现多模型 leaderboard 显示,三类威胁和八种可注入行为的检测策略存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07023 2026-03-25 q-fin.TR cs.AI 57%

Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation

对LLM代理的行为一致性验证:通过股票市场模拟分析交易风格切换

Zeping Li, Guancheng Wan, Keyang Chen, Yu Chen, Yiwen Zhao, Philip Torr, Guangnan Ye, Zhenfei Yin, Hongfeng Chai

机构 * Fudan University(复旦大学) Wuhan University(武汉大学) BNP Paribas(BNP巴黎银行) Oxford University(牛津大学) Haven

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过股票市场模拟分析交易风格切换,评估LLM代理策略切换与金融理论的一致性,提出四个行为金融驱动因素作为性格特质,并通过Mann-Whitney U检验比较策略切换行为与理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05318 2026-03-25 cs.AI 57%

BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation for Large Language Models via Lens of Dynamic Interactions

BIRD-INTERACT:通过动态交互视角重新审视大型语言模型的文本到SQL评估

Nan Huo, Xiaohan Xu, Jinyang Li, Per Jacobsson, Shipei Lin, Bowen Qin, Binyuan Hui, Xiaolong Li, Ge Qu, Shuzheng Si, Linheng Han, Edward Alexander, Xintong Zhu, Rui Qin, Ruihan Yu, Yiyao Jin, Feige Zhou, Weihao Zhong, Yun Chen, Hongyu Liu, Chenhao Ma, Fatma Ozcan, Yannis Papakonstantinou, Reynold Cheng

机构 * The University of Hong Kong(香港大学) Google Cloud(谷歌云) The BIRD Team(BIRD团队)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出BIRD-INTERACT基准,通过动态交互环境和双重评估设置,解决多轮对话中模糊查询和执行错误等问题,验证有效交互对复杂SQL任务的重要性。

Comments ICLR 2026 Oral. Dataset and code available at https://bird-interact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08916 2026-03-25 cs.LG math.DS q-bio.QM 57%

Enhancing generalizability of model discovery across parameter space with multi-experiment equation learning (ME-EQL)

通过多实验方程学习提升参数空间中的模型泛化能力(ME-EQL)

Maria-Veronica Ciocanel, John T. Nardini, Kevin B. Flores, Erica M. Rutter, Suzanne S. Sindi, Alexandria Volkening

机构 * Departments of Mathematics and Biology, Duke University(数学与生物学系,杜克大学) Department of Mathematics and Statistics, The College of New Jersey(数学与统计学系,新泽西学院) Department of Mathematics, Center for Research in Scientific Computation, North Carolina State University(数学系,科学计算研究中心,北卡罗来纳州立大学) Department of Applied Mathematics, University of California, Merced(应用数学系,加州大学默塞德分校) Department of Mathematics, Purdue University(数学系,普渡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出ME-EQL方法,通过单变量和嵌入结构两种方式提升从多实验中学习模型的泛化能力,减少参数恢复误差。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07396 2026-03-25 quant-ph cs.AI 57%

Automating quantum feature map design via large language models

通过大语言模型自动化量子特征图设计

Kenya Sakka, Kosuke Mitarai, Keisuke Fujii

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) Graduate School of Engineering Science(工程科学研究生院) RIKEN Center for Quantum Computing(理化学研究所量子计算中心)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型自主生成、评估和优化量子特征图,通过实验在MNIST等数据集上实现超越现有量子特征图的性能,展示了闭环发现方法在量子电路设计中的应用价值。

Comments 39 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21630 2026-03-24 cs.AI 57%

EnterpriseLab: A Full-Stack Platform for developing and deploying agents in Enterprises

EnterpriseLab:企业中开发和部署代理的全栈平台

Ankush Agarwal, Harsh Vishwakarma, Suraj Nagaje, Chaitanya Devaguptapu

机构 * Fujitsu Research India(富士通印度研究)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文提出EnterpriseLab,一个统一开发和部署企业代理的全栈平台,通过模块化环境、自动化数据生成和集成训练管道,提升企业代理的能力与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19961 2026-03-24 cs.CL cs.IR 57%

Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval

解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿

Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文综述了视觉文档检索领域,探讨了多模态大语言模型时代下的方法演进与挑战,提出未来发展方向。

Comments Under review. This version updates the relevant works released before 15 March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01503 2026-03-24 cs.CL 57%

A Theory of Adaptive Scaffolding for LLM-Based Pedagogical Agents

基于大语言模型的教育代理自适应支架理论

Clayton Cohn, Surya Rayala, Namrata Srivastava, Joyce Horn Fonteles, Shruti Jain, Xinying Luo, Divya Mereddy, Naveeduddin Mohammed, Gautam Biswas

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出结合证据中心设计与社会认知理论的自适应支架框架,开发出Inquizzitor评估代理,通过人机混合智能提供基于认知科学的反馈,验证了理论驱动的大语言模型在教育中的应用潜力。

Comments Published in the proceedings of AAAI 2026 (main technical track)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(3), 1757-1765. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21427 2026-03-24 cs.SE 57%

Dynasto: Validity-Aware Dynamic-Static Parameter Optimization for Autonomous Driving Testing

Dynasto:面向自动驾驶测试的有效性感知动态-静态参数优化

Dmytro Humeniuk, Mohammad Hamdaqa, Houssem Ben Braiek, Amel Bennaceur, Foutse Khomh

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 Dynasto通过联合优化初始场景参数和动态对抗行为,发现更多真实安全关键故障,揭示自动驾驶系统中的弱点。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05984 2026-03-24 cs.LG 57%

Parameter-free Optimal Rates for Nonlinear Semi-Norm Contractions with Applications to $Q$-Learning

无参数最优收敛速率的非线性半范数收缩方法及其在Q学习中的应用

Ankur Naskar, Gugan Thoppe, Vijay Gupta

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出通过将平均误差转化为线性递推并结合半范数收缩与诱导范数单调性,实现了Q学习在平均回报和指数折扣设置中无参数的最优收敛速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15127 2026-03-24 cs.LG cs.IT math.IT stat.ML 57%

Asymptotically and Minimax Optimal Regret Bounds for Multi-Armed Bandits with Abstention

渐近最优和最小最大最优的多臂老虎机问题中的弃权后悔界

Junwen Yang, Tianyuan Jin, Vincent Y. F. Tan

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Department of Electrical and Computer Engineering(电子与计算机工程系) Department of Mathematics(数学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出多臂老虎机问题的新扩展,引入弃权策略,探讨在该设定下计算高效且渐近最优的算法设计,通过理论分析和实验验证弃权选项的实用价值。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19461 2026-03-23 cs.AI 57%

Hyperagents

超智能体

Jenny Zhang, Bingchen Zhao, Wannan Yang, Jakob Foerster, Jeff Clune, Minqi Jiang, Sam Devlin, Tatiana Shavrina

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) University of Edinburgh(爱丁堡大学) New York University(纽约大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席) FAIR at Meta(Meta 的 FAIR 部门) Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出超智能体,通过整合任务智能体和元智能体,实现自我改进。DGM-H在多个领域表现出色,持续改进搜索方法。

Comments Code at https://github.com/facebookresearch/Hyperagents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18813 2026-03-20 cs.AI 57%

Can LLM generate interesting mathematical research problems?

大语言模型能否生成有趣的数学研究问题?

Xiaoyang Chen, Xiang Jiang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨大语言模型能否生成有价值的前沿数学研究问题,通过生成665个微分几何问题并经人类验证,发现许多问题对专家而言尚属未知且具有独特研究价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18762 2026-03-20 cs.CR cs.AI 57%

ClawTrap: A MITM-Based Red-Teaming Framework for Real-World OpenClaw Security Evaluation

ClawTrap:一种基于中间人攻击的红队框架,用于现实世界OpenClaw安全评估

Haochen Zhao, Shaoyang Cui

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ClawTrap,一种基于中间人攻击的红队框架,用于评估现实世界OpenClaw的安全性。该框架支持多种定制化攻击形式,提供可重复的管道流程,用于规则驱动的拦截、转换和审计。

Comments 8 pages, 5 figures, 2 tables. Preliminary technical report; quantitative experiments and extended evaluation to appear in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07300 2026-03-20 cs.LG 57%

AutoResearch-RL: Perpetual Self-Evaluating Reinforcement Learning Agents for Autonomous Neural Architecture Discovery

AutoResearch-RL:持续自我评估的强化学习代理用于自主神经架构发现

Nilesh Jain, Rohit Yadav, Sagar Kotian, Claude AI

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 AutoResearch-RL通过强化学习代理持续自主发现神经网络架构和超参数,无需人工监督,通过验证位率指标优化策略,实现高效实验迭代。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18326 2026-03-20 cs.LG 57%

Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration

摆脱离线悲观主义:用于安全前沿探索的向量场奖励塑造

Amirhossein Roknilamouki, Arnob Ghosh, Eylem Ekici, Ness B. Shroff

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出向量场奖励塑造方法,通过梯度对齐和旋转向量项诱导持续安全前沿探索,验证了在连续导航任务中有效平衡安全与信息收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18035 2026-03-20 cs.LG 57%

Taming Epilepsy: Mean Field Control of Whole-Brain Dynamics

癫痫控制:整体脑动力学的均场控制

Ming Li, Ting Gao, Jingqiao Dua

机构 * School of Mathematics and Information Science(数学与信息科学学院) Guangzhou University(广州大学) School of Sciences(科学学院) Great Bay University(大亚湾大学) Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力系统重点实验室) School of Mathematics and Statistics(数学与统计学学院) Huazhong University of Science and Technology(华中科技大学) Center for Mathematical Science(数学科学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于图正则化的Koopman均场游戏框架,通过Reservoir Computing和Alternating Population and Agent Control Network实现脑神经动力学的非线性控制,有效抑制癫痫发作并保持脑功能拓扑结构。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20558 2026-03-20 cs.AI cs.IR 57%

From Logs to Language: Learning Optimal Verbalization for LLM-Based Recommendation at Industry Scale

从日志到语言:学习用于基于LLM的推荐系统的最优 verbalization

Yucheng Shi, Ying Li, Yu Wang, Yesu Feng, Arjun Rao, Rein Houthooft, Shradha Sehgal, Jin Wang, Hao Zhen, Ninghao Liu, Linas Baltrunas

机构 * University of Georgia(佐治亚大学) Netflix Capital One Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种数据驱动框架,通过强化学习学习最优 verbalization 方法,提升基于LLM的推荐系统表现,实验显示在Netflix数据集上推荐准确率提升达93%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06023 2026-03-20 cs.AI cs.RO 57%

Developing a Discrete-Event Simulator of School Shooter Behavior from VR Data

基于VR数据开发校园枪击行为离散事件模拟器

Christopher A. McClurg, Alan R. Wagner

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出一种数据驱动的离散事件模拟器,用于模拟校园枪击行为,通过VR数据学习枪手行为,评估机器人干预策略,实现高效安全干预策略的可扩展评估。

Comments Accepted for presentation at ANNSIM 2026. Camera-ready version. 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05089 2026-03-19 cs.CR cs.LG cs.RO 57%

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

警惕不可信的模拟器 -- 强化学习中的无奖励后门攻击

Ethan Rathbun, Wo Wei Lin, Alina Oprea, Christopher Amato

机构 * Khoury College of Computer Sciences(计算机科学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种新型攻击'Daze',通过模拟器动态在强化学习代理中隐秘植入动作级后门,无需修改或观察奖励,证明其在通用RL任务中的有效性,并展示其在机器人硬件上的迁移。

Comments 10 pages main body, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17234 2026-03-19 cs.CY cs.AI 57%

Deployment and Evaluation of an EHR-integrated, Large Language Model-Powered Tool to Triage Surgical Patients

一种集成电子健康记录的大型语言模型驱动工具在手术患者分诊中的部署与评估

Jane Wang, Timothy Keyes, April S Liang, Stephen P Ma, Jason Shen, Jerry Liu, Nerissa Ambers, Abby Pandya, Rita Pandya, Jason Hom, Natasha Steele, Jonathan H Chen, Kevin Schulman

机构 * Division of Hospital Medicine, Department of Medicine, Stanford University(斯坦福大学医院医学部,医学部) Stanford University School of Medicine(斯坦福大学医学院) Stanford Health Care, Technology and Digital Solutions(斯坦福健康,技术与数字解决方案) Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) Stanford Health Care, Nursing Informatics(斯坦福健康,护理信息学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出一种基于大型语言模型的工具,用于自动化手术患者分诊,通过电子健康记录实现,具有高灵敏度和中等特异性,展示了人工智能在医疗分诊中的应用价值。

Comments 35 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21721 2026-03-18 cs.AI cs.HC 57%

PREFINE: Personalized Story Generation via Simulated User Critics and User-Specific Rubric Generation

PREFINE:通过模拟用户批评和用户特定评分标准实现个性化故事生成

Kentaro Ueda, Takehiro Takayanagi

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) The University of Tokyo(东京大学) Simulacra Inc.(Simulacra公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PREFINE通过模拟用户批评和生成用户特定评分标准,实现无需用户反馈的个性化故事生成,提升个性化效果并保持通用质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20606 2026-03-18 cs.GT cs.CY cs.LG econ.TH 57%

Strategic Costs of Perceived Bias in Fair Selection

公平选拔中的感知偏见战略成本

L. Elisa Celis, Lingxiao Huang, Milind Sohoni, Nisheeth K. Vishnoi

机构 * Yale University(耶鲁大学) Nanjing University(南京大学) IIT Bombay(印度理工学院班加罗尔分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过博弈论模型分析不同社会经济群体在感知后选择价值差异下的努力分配,揭示这种差异如何影响代表性、社会福利和效用,提出成本敏感优化框架以减少不平等。

Comments The paper has been accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15185 2026-03-17 cs.RO cs.AI cs.CV 57%

What Matters for Scalable and Robust Learning in End-to-End Driving Planners?

在端到端驾驶规划器中,可扩展性和鲁棒性学习中什么重要?

David Holtz, Niklas Hanselmann, Simon Doll, Marius Cordts, Bernt Schiele

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Max-Planck-Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文研究了端到端驾驶规划器中可扩展性和鲁棒性学习的关键因素,提出BevAD架构在Bench2Drive基准上达到72.7%的成功率,展示了纯模仿学习的数据扩展能力。

Comments To be published in CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12720 2026-03-17 cs.CL cs.CV cs.MM cs.SD 57%

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

Omni-Captioner:多模态信息细粒度感知的数据管道、模型与基准

Ziyang Ma, Ruiyang Xu, Zhenghao Xing, Yunfei Chu, Yuxuan Wang, Jinzheng He, Jin Xu, Pheng-Ann Heng, Kai Yu, Junyang Lin, Eng Siong Chng, Xie Chen

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出Omni-Captioner,通过数据管道、模型和基准系统,系统研究多模态细粒度感知,提出Omni-Detective生成高质量数据,实现音频和视频细粒度描述的最优性能。

Comments Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13773 2026-03-17 cs.CL 57%

LiveWeb-IE: A Benchmark For Online Web Information Extraction

LiveWeb-IE:一个在线网页信息提取的基准测试

Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出LiveWeb-IE基准测试,用于评估在线网页信息提取系统,通过活体网站和多阶段代理框架VGS,提升信息提取的准确性和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13744 2026-03-17 cond-mat.mtrl-sci cs.AI 57%

Research Paradigm of Materials Science Tetrahedra with Artificial Intelligence

材料科学四面体与人工智能的研究范式

Shiyun Zhang, Yibo Yao, Haoquan Long, Dingwen Tao, Guangming Tan, Wei-Hua Wang, Yuan-Chao Hu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了经典材料四面体研究范式,并提出两个新的AI增强研究范式,旨在推动数据驱动和AI辅助的材料科学研究。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13686 2026-03-17 cs.SD cs.AI 57%

$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

$τ$-Voice:在真实领域上评估全双工语音代理的基准测试

Soham Ray, Keshav Dhandhania, Victor Barres, Karthik Narasimhan

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出$τ$-voice基准测试,评估语音代理在真实复杂任务中的表现,发现语音代理在清洁条件和嘈杂环境下任务完成率仅为31-51%和26-38%,远低于文本能力,表明代理行为是失败的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR 57%

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏