arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2605.11680 2026-05-13 cs.CV 50%

ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes

ShapeCodeBench:一种可再生的基准,用于合成形状场景的感知到程序重建

Shivam Kumar

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract)

AI总结 ShapeCodeBench是一个合成基准,用于测试从渲染图像生成可执行程序的能力。该基准包含不同难度层级的样本,评估了多种模型在精确匹配、像素精度和执行成功率上的表现。

Comments 14 pages, 5 figures, 2 tables. Code, data, and artifacts: https://github.com/shivamk3r/shape-code-bench ; archival release: https://doi.org/10.5281/zenodo.20132286

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11268 2026-05-13 cs.CR 50%

Context-Aware Spear Phishing: Generative AI-Enabled Attacks Against Individuals via Public Social Media Data

具有上下文意识的钓鱼攻击:通过公共社交媒体数据利用生成式AI对个人进行攻击

Elham Pourabbas Vafa, Sayak Saha Roy, Shirin Nilizadeh

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文研究了如何利用公开社交媒体数据和生成式AI自动化并扩大针对个人的个性化、上下文感知的钓鱼攻击。通过模块化框架结合多模态信号提取、沟通风格分析和攻击类型实例化,展示了七种攻击策略,并通过大规模多模型评估验证了生成式AI邮件在个性化、上下文相关性和说服力方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09904 2026-05-13 cs.CV 50%

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

TOC-Bench:一个用于视频大语言模型的时序物体一致性基准

Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

机构 * Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 TOC-Bench旨在评估视频大语言模型的时序物体一致性,通过设计三层时序必要性过滤协议,筛选出17900个时间依赖项,构建了包含2323个高质量问答对的基准,揭示了模型在事件计数、事件排序等任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10904 2026-05-12 cs.RO 50%

MDrive: Benchmarking Closed-Loop Cooperative Driving for End-to-End Multi-agent Systems

MDrive:端到端多智能体系统的闭环协作驾驶基准测试

Marco Coscoy, Zewei Zhou, Seth Z. Zhao, Henry Wei, Angela Magtoto, Johnson Liu, Rui Song, Walter Zimmer, Zhiyu Huang, Chen Tang, Bolei Zhou, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :planning(abstract)

AI总结 MDrive基准测试通过225个基于NHTSA预碰撞类型和真实V2X数据的场景,评估多智能体系统在闭环驾驶中的性能,发现多智能体系统在规划方面通常优于单智能体系统,但面临感知共享和协商在复杂交通中的挑战。

Comments website:https://mdrive-challenge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10858 2026-05-12 cs.CV cs.RO 50%

Is Your Driving World Model an All-Around Player?

你的驾驶世界模型是全能选手吗?

Lingdong Kong, Ao Liang, Tianyi Yan, Hongsi Liu, Wesley Yang, Ziqi Huang, Xian Sun, Wei Yin, Jialong Zuo, Yixuan Hu, Dekai Zhu, Dongyue Lu, Youquan Liu, Guangfeng Jiang, Linfeng Li, Xiangtai Li, Long Zhuo, Lai Xing Ng, Benoit R. Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, Ziwei Liu

专题命中 推理评测 :planning(abstract)

AI总结 本文提出WorldLens基准测试,评估驾驶世界模型在视觉和行为真实性方面的综合表现,揭示现有模型在不同维度上的不足,并引入WorldLens-26K和WorldLens-Agent提升评估的可解释性。

Comments CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10434 2026-05-12 cs.CV 50%

WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors

WorldReasonBench: 视频生成器作为未来世界状态预测器的人类对齐压力测试

Keming Wu, Yijing Cui, Wenhan Xue, Qijie Wang, Xuan Luo, Zhiyuan Feng, Zuhao Yang, Sudong Wang, Sicong Jiang, Haowei Zhu, Zihan Wang, Ping Nie, Wenhu Chen, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(abstract)

AI总结 WorldReasonBench通过结构化地面真实QA注释,测试视频生成器能否在物理、社会、逻辑和信息层面保持一致性。该基准包含436个测试案例和22个子类别,结合人类对齐的两阶段方法评估生成视频的质量。

Comments Project Page: https://unix-ai-lab.github.io/WorldReasonBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10251 2026-05-12 cs.CV 50%

Efficient Hybrid CNN-GNN Architecture for Monocular Depth Estimation

高效混合CNN-GNN架构用于单目深度估计

Ishan Narayan

机构 * IMCS Lab, CSIR-CSIO(IMCS实验室,CSIR-CSIO)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GraphDepth架构,通过在卷积编码器-解码器框架中整合图神经网络,有效建模长距离空间关系,提升单目深度估计的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV 50%

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07574 2026-05-12 cs.CV 50%

PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

PolarVLM:弥合视觉语言模型中的语义-物理差距

Yuliang Li, Chu Zhou, Heng Guo, Boxin Shi, Imari Sato, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) National Institute of Informatics, Japan(日本国立信息机构) Peking University, China(北京大学) The University of Tokyo, Japan(东京大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。

Comments 23 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09703 2026-05-12 cs.CV 50%

MOTOR-Bench: A Real-world Dataset and Multi-agent Framework for Zero-shot Human Mental State Understanding

MOTOR-Bench:一个现实世界数据集和多智能体框架,用于零样本人类心理状态理解

Xiaoyu Yuan, Niklas Heikkala, Tiina Törmänen, Hanna Järvenoja, Guoying Zhao, Haoyu Chen

机构 * University of Oulu(奥卢大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MOTOR-Bench,通过现实世界数据集和多智能体框架,解决零样本人类心理状态理解问题,展示了多智能体框架在行为、认知和情绪预测上的优越性能。

Comments Accepted by CVPR 2026 workshop AI4RWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05831 2026-05-12 cs.CV 50%

Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media

统一科学交流:跨科学媒体的细粒度对应

Megha Mariam K. M, Vineeth N. Balasubramanian, C. V. Jawahar

机构 * IIIT Hyderabad(IIIT海得拉尔学院) Microsoft Research India & IIT Hyderabad(微软研究院印度分部及IIIT海得拉尔学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MCD数据集,通过整合科研论文、演示视频、解释视频和幻灯片,评估不同模型在发现跨格式细粒度对应关系中的能力,揭示了视觉语言模型和嵌入模型的优缺点。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09534 2026-05-12 cs.CV 50%

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08763 2026-05-12 cs.CR 50%

When LLMs Team Up: A Coordinated Attack Framework for Automated Cyber Intrusions

当大语言模型协同作战:一种用于自动化网络入侵的协同攻击框架

Minfeng Qi, Tianqing Zhu, Zijie Xu, Congcong Zhu, Qin Wang, Wanlei Zhou

专题命中 推理评测 :planning(abstract)

AI总结 本文提出CAESAR框架,通过分解任务为五个角色并协调执行,提高自动化入侵任务的成功率并减少性能波动,尤其在需要多步骤利用组合的任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08486 2026-05-12 cs.CY 50%

Teachers' Perceived Benefits and Risks of AI Across Fifty-Five Countries: An Audit of LLM Alignment and Steerability

教师对AI在教育中的感知益处与风险:对LLM对齐与可控性的审计

Yan Tao, Olga Viberg, Deepak Varuvel Dennison, Zhikun Wu, René F. Kizilcec

专题命中 推理评测 :reasoning(abstract)

AI总结 研究通过分析55国教师对AI的感知益处与风险,评估LLM在教育领域应用的对齐与可控性,揭示模型输出与现实差异,警示LLM不能替代教师直接反馈。

Comments Accepted as full paper to the 13th ACM Conference on Learning @ Scale (L@S'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13710 2026-05-12 cs.CV 50%

SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs

SLQ:通过共享潜在查询桥接模态以实现冻结MLLMs的检索

Haoran Lou, Ziyan Liu, Chunxiao Fan, Yuexin Wu, Yue Ming, Hao Wu, Kai Zuo, Yibo Chen, Xu Tang

机构 * School of Electronic Engineering, Beijing University of Posts(北京邮电大学电子工程学院) Xiaohongshu Inc., China(小红书公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 SLQ通过冻结MLLMs的主干,引入共享潜在查询提升多模态检索性能,实验显示其在多个基准上表现优异。

Comments Accepted to ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27157 2026-05-12 cs.IR 50%

A Survey on Generative Recommendation: Data, Model, and Tasks

生成推荐的综述:数据、模型与任务

Min Hou, Le Wu, Yuxin Liao, Yonghui Yang, Zhen Zhang, Yu Wang, Changlong Zheng, Han Wu, Richang Hong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述生成推荐领域,探讨数据、模型与任务维度,分析生成模型在推荐中的应用与挑战,提出智能推荐助手的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09158 2026-05-12 cs.CV 50%

FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO

FaVChat: 基于数据高效GRPO的层次提示-查询引导的面部视频理解

Fufangchen Zhao, Songbai Tan, Xuerui Qiu, Linrui Xun, Wenhao Jiang, Jinkai Zheng, Hehe Fan, Jian Gao, Danfeng Yan, Ming Li

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(北京邮电大学网络与交换技术国家重点实验室) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Central South University(中南大学) Zhejiang University(浙江大学) College of communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 FaVChat通过层次化提示引导框架提取面部动态细节信息,结合数据高效GRPO策略提升学习效率,实现在面部视频理解任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08104 2026-05-12 cs.CR 50%

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

AgentCrypt: 推动AI代理协作中的隐私与(安全)计算发展

Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

专题命中 推理评测 :reasoning(abstract)

AI总结 AgentCrypt通过三层框架提升AI代理协作中的隐私和安全计算,解决传统访问控制不足和LLM安全性的不足问题,实现数据安全计算和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00780 2026-05-11 cs.SE 50%

Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems

语言模型能否超越编程?评估语言模型构建现实系统的能力

Chenyu Zhao, Shenglin Zhang, Zeshun Huang, Weilin Jin, Yongqian Sun, Dan Pei, Chaoyun Zhang, Qingwei Lin, Chetan Bansal, Saravan Rajmohan, Minghua Ma

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Build-bench基准,评估语言模型在跨指令集架构迁移中修复构建失败的能力,发现当前模型最大成功率为63.19%,并揭示了不同模型在工具使用上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07466 2026-05-11 cs.CV 50%

A Unified Framework for the Detection and Classification of Fatty Pancreas in Ultrasound Images

一种用于超声图像中脂肪性胰腺检测与分类的统一框架

Ioan-Tudor-Alexandru Anghel, Ciprian-Mihai Ceausescu, Elena Dana Nedelcu, Elena Raluca Stirban, Camelia Croitoru, Despina Ungureanu, Ana Maria Palan, Gabriela Pop

机构 * Faculty of Mathematics and Computer Science, University of Bucharest(布加勒斯大学数学与计算机科学学院) Ponderas Academic Hospital, Radiology(波内拉斯学术医院放射科) Ponderas Academic Hospital, Internal Medicine(波内拉斯学术医院内科) Ponderas Academic Hospital, Gastroenterology(波内拉斯学术医院胃肠病科) Emergency Clinical Hospital Bucharest, Radiology Department(布加勒斯急救临床医院放射科)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种端到端框架,通过分割引导的纹理分析自动分类正常与脂肪性胰腺,采用TransUNet架构结合ResNet和Transformer,实现胰腺和脾静脉分割,并通过纹理比较进行分类,验证了在无标注数据下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07457 2026-05-11 cs.CV 50%

EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement

EditRefiner:一种对齐人类的代理框架用于图像编辑细化

Zitong Xu, Huiyu Duan, Yifei Nie, Mingda Du, Sijing Wu, Xiongkuo Min, Tianyi Zheng, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(Vivo移动通信有限公司) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EditRefiner,一种对齐人类的代理框架,通过人类反馈数据集改进图像编辑的细粒度问题,通过感知-推理-行动-评估循环提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06910 2026-05-11 cs.CR 50%

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

对对抗性代码混淆和加密下大型语言模型进行IoC恢复的基准测试

Jaime Morales, Sergio Pastrana, Juan Tapiador

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一个系统性基准测试,评估LLM在对抗性代码转换下恢复隐藏的IoC能力,发现加密技术显著降低检测性能,揭示LLM在代码分析中的局限性及改进方向。

Comments 11 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02934 2026-05-11 cs.SE 50%

AgenticSZZ: Temporal Knowledge Graph-Guided Agentic Bug-Inducing Commit Identification

AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。

Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06486 2026-05-08 cs.CR 50%

Autonomous Adversary: Red-Teaming in the age of LLM

自主对抗者:在LLM时代进行红队测试

Mohammad Mamun, Mohamed Gaber, Scott Buffett, Sherif Saad

专题命中 推理评测 :planning(abstract)

AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。

Comments Accepted at ACISP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06125 2026-05-08 cs.SE 50%

Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution

打破、过时或缺失?基于项目级测试演变的基准测试

Ye Shang, Quanjun Zhang, Haichuan Hu, Chunrong Fang, Liang Xiao, Zhenyu Chen

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TEBenchmark,首个项目级测试演变基准,评估系统自主识别需修改的测试、确定新测试需求并生成测试补丁的能力,揭示测试演变任务的性能上限。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06095 2026-05-08 cs.CV 50%

Metonymy in vision models undermines attention-based interpretability

视觉模型中的隐喻破坏基于注意力的可解释性

Ananthu Aniraj, Cassio F. Dantas, Dino Ienco, Massimiliano Mancini, Diego Marcos

机构 * Inria, EVERGREEN, University of Montpellier, 34090 Montpellier, France(Inria、EVERGREEN、蒙彼利埃大学) INRAE, UMR TETIS, University of Montpellier, 34090 Montpellier, France(INRAE、UMR TETIS、蒙彼利埃大学) University of Trento, Trento, Italy(特伦托大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究发现现代预训练视觉Transformer违反局部性假设,导致物体内部泄漏,影响基于部分推理的可解释性方法,提出两阶段方法缓解该问题。

Comments 28 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 50%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05640 2026-05-08 cs.CV 50%

AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries

AffectSeek: 长视频中基于模糊用户查询的代理情感理解

Zhen Zhang, Yuhang Yang, Yunxiang Jiang, Yuhuan Lu, Haifeng Lu, Zheng Lian, Runhao Zeng, Xiping Hu

机构 * Gansu Provincial Key Laboratory of Wearable Computing, School of Information Science and Engineering, Lanzhou University(甘肃省可穿戴计算重点实验室,兰州大学信息科学与工程学院) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing, Shenzhen MSU-BIT University(粤港澳大湾区情感智能与泛在计算联合实验室,深圳MSU-BIT大学) Department of Computer and Information Engineering, Khalifa University(计算机与信息工程系,哈利法大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Department of Electrical and Computer Engineering, The University of Hong Kong(电子与计算机工程系,香港大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出VQAU任务,要求模型在长视频中定位情感时刻、预测情绪类别并生成证据支持的解释。构建VQAU-Bench基准,并提出AffectSeek框架,通过分步推理实现模糊查询驱动的情感理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03117 2026-05-08 cs.CR 50%

AgentDyn: Are Your Agent Security Defenses Deployable in Real-World Dynamic Environments?

AgentDyn: 您的代理安全防御能在现实世界动态环境中部署吗?

Hao Li, Ruoyao Wen, Shanghao Shi, Ning Zhang, Yevgeniy Vorobeychik, Chaowei Xiao

专题命中 推理评测 :planning(abstract)

AI总结 本文揭示现有代理安全基准的三大缺陷,提出AgentDyn基准,包含60个挑战性开放任务和560个注入测试用例,评估十种先进防御,发现现有防御不足或过度防御,亟需更适应动态环境的基准。

Comments 26 Pages, 17 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01481 2026-05-08 cs.SE 50%

TSGuard: Automated User-Centric Incident Diagnosis for AI Workloads in the Cloud

TSGuard:云中AI工作负载的自动化用户导向事件诊断

Yitao Yang, Yangtao Deng, Yifan Xiong, Baochun Li, Hong Xu, Peng Cheng

专题命中 推理评测 :reasoning(abstract)

AI总结 TSGuard通过构建领域知识库和模拟专家诊断,提升云中AI工作负载事件诊断的准确性和效率,验证结果显示其在诊断准确率和验证时间上均优于现有方法。

Comments Camera-ready version for ACM FSE 2026 (PACMSE)

详情

展开后加载摘要…

URL PDF HTML 收藏