arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2606.22318 2026-06-23 q-bio.OT 新提交 50%

PROMPT: A Pre-registered Randomized Protocol for Component-Level Evaluation of Clinical AI Prompts

PROMPT:临床AI提示组件级评估的预注册随机协议

Bin Hu, Avneek Sandhu, Shahryar Wasif

专题命中 安全评测 :safety(abstract)

AI总结 提出PROMPT协议,通过预注册、随机化、匹配对照和拆解设计,在合成和医学图像任务中识别提示组件的有益、有害和无效效应,揭示整体提示评估遗漏的安全漏洞。

Comments 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23354 2026-06-23 cs.CV 新提交 50%

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

通过学习的代理令牌实现忠实的接地视觉推理

Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo, Angelique Loesch

机构 * CEA-LIST(法国原子能委员会-信息与系统技术实验室)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出Composer模型,利用基于学习代理令牌的视觉接地机制,通过离散符号指针显式索引图像潜在空间,在保持答案准确性的同时将视觉接地准确率提升9.0个百分点。

Comments Accepted at ICIP 2026. Code, model and data available at: https://github.com/CEA-LIST/Composer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22399 2026-06-23 cs.SD 新提交 50%

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

ATCCaps: 一个面向空中交通管制识别的呼号感知语音数据集

Dongdong Li, Jianwei Song, Jianwei Wang, Zhe Wang

机构 * East China University of Science and Technology(华东理工大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出ATCCaps,一个基于真实无线电通话构建的呼号感知语音数据集,包含202.94小时音频和17万条话语,通过结合置信度感知的转录解析、ADS-B呼号元数据、规则过滤和LLM辅助字幕生成,支持ASR评估、呼号匹配和音频-文本检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 50%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 安全评测 :safety(abstract)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21538 2026-06-23 physics.flu-dyn 新提交 50%

Turbulence Physics Governs a Scaling Law for the Machine-Learning Predictability Ceiling in Chaotic Flow

湍流物理支配混沌流中机器学习可预测性上限的标度律

Jiashun Guan, Haoyang Hu, Yunxiao Ren, Michael S. Triantafyllou, Dixia Fan

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究揭示混沌流中机器学习预测精度随预报时长恶化的标度律,源于湍流理论而非模型缺陷,并通过钝体绕流高保真仿真验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 50%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 安全评测 :prompt injection(abstract)

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19703 2026-06-19 cs.HC 新提交 50%

Vibe Coding for Visualization Implementation: An Empirical Study of Practices and Challenges

Vibe Coding 用于可视化实现:实践与挑战的实证研究

Zhengyu Sun, Xiaolin Wen, Fengjie Wang, Can Liu, Yi Lai, Christophe Hurter, Yong Wang

专题命中 安全评测 :alignment(abstract)

AI总结 通过16名参与者的实证研究,探讨用户使用AI驱动的自然语言交互工具生成可视化时的实践(提示、评估、迭代)和挑战。

Comments 5 pages, 2 figures. Short paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17128 2026-06-19 cs.AR 新提交 50%

Shift-Left High-Level Synthesis Verification via Knowledge-Augmented LLM Agent

通过知识增强的LLM智能体实现左移高层次综合验证

Zhihan Xiao, Hongbing Lang, Zhe Zhao, Luke Ztz Hu, Songping Mai

专题命中 安全评测 :alignment(abstract)

AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19062 2026-06-18 cs.CV 新提交 50%

DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval

DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索

Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik

机构 * Sejong University(世宗大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Ulsan National Institute of Science and Technology(乌山国立科学研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出DREAM模型,通过双路径表示增强与对齐,结合层级视觉编码器和混合语言建模,在视频检索任务中实现新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17458 2026-06-17 cs.CE 新提交 50%

ICBCBench: An Industry Consortium Benchmark for Financial Deep Research

ICBCBench:面向金融深度研究的行业联盟基准

Weiya Li, Zhiwei Tang, Yizhou He, Chenghao Wang, Liang Feng, Xiao Sun, Dongrui Liu, Zichen Wen, Hu Wei, Jinghang Wang, Yi Luo, Li Guo, Linfeng Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 针对金融领域深度研究代理评估标准缺失的问题,提出ICBCBench基准,采用客观任务与主观报告评估双轨范式,揭示当前模型在复杂推理、事实依据和报告质量上的显著差距。

Comments 33 pages, 14 figures. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14383 2026-06-17 cs.CV 新提交 50%

IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

IndustryBench-MIPU:面向工业产品的多图像属性值提取基准

Haonan Qi, Jin Cao, Yongqi Zhang, Xintong Wang, Weidong Tang, Bin Chen, Chengfu Huo, Haojun Pan, Hengyu You, Jing Li, Yingde Wang, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队) Taobao&Tmall, Alibaba Group(淘宝&天猫,阿里巴巴集团)

专题命中 安全评测 :safety(abstract)

AI总结 提出首个多图像工业产品理解基准IndustryBench-MIPU,通过结构化属性提取任务评估多模态大模型在规格表、铭牌、技术图纸上的文本识别、视觉推理、领域知识和跨图像证据整合能力,发现多图像完整性是核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01762 2026-06-17 cs.RO cs.CV 版本更新 50%

AlignDrive: Aligned Lateral-Longitudinal Planning for End-to-End Autonomous Driving

AlignDrive: 用于端到端自动驾驶的对齐横向-纵向规划

Yanhao Wu, Haoyang Zhang, Fei He, Rui Wu, Yanhu Shan, Congpei Qiu, Liang Gao, Wei Ke, Tong Zhang

机构 * School of Software Engineering, XJTU(软件工程学院,西安交通大学) Horizon Robotics Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种 cascaded 框架,通过将纵向规划转化为路径条件推理过程,提升自动驾驶的协调性和安全性。方法引入锚点回归设计和规划导向的数据增强策略,实现在 Bench2Drive 上达到 SOTA 性能。

Comments underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16871 2026-06-16 cs.MA 新提交 50%

Human-on-the-Bridge: Scalable Evaluation for AI Agents

Human-on-the-Bridge: 可扩展的AI智能体评估方法

Fouad Bousetouane

专题命中 安全评测 :red teaming(abstract)

AI总结 提出Human-on-the-Bridge (HOB)范式,通过专家预先策划可复用的评估智能体(包括领域上下文、红队陷阱、陪审员角色等),结合ProofAgent测试框架进行多轮对抗评估,实现可扩展的AI智能体行为评估。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15200 2026-06-16 cs.CV 新提交 50%

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

铭记于心:面向用户中心的持续空间智能推理在自我中心视频流中的应用

Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出UCS-Bench数据集和DirectMe框架,通过增量构建结构化空间记忆,实现自我中心视频流中动态空间推理、长期记忆与用户实时位置对齐,显著提升多模态大模型的空间推理能力。

Comments 45 pages. https://icml.cc/virtual/2026/poster/63682

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15136 2026-06-16 cs.PF 新提交 50%

LLMs have Visualization Literacy: Now What? Experiments Exploring LLM Visualization Evaluation Capabilities

LLMs 具备可视化素养:现在呢?探索 LLM 可视化评估能力的实验

Christian Seto, Jacqueline Nguyen, Jiayi Hong, Ross Maciejewski

专题命中 安全评测 :trustworthy(abstract)

AI总结 通过实验评估最新 LLM 在可视化素养、指令遵循和图形完整性方面的能力,发现其可视化素养超越人类,但在指令遵循和识别误导性可视化方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15020 2026-06-16 cs.CR 新提交 50%

Semantic Integrity Failures in Document-to-LLM Supply Chains

文档到LLM供应链中的语义完整性失败

Side Liu, Jiang Ming

专题命中 安全评测 :safety(abstract)

AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09098 2026-06-16 eess.AS 新提交 50%

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音

Wenhao Guan, Yifan Duan, Junxi Liu, Yu Gu, Feng Dang, Kaidi Wang, Qingyang Hong, Lin Li, Xie Chen

专题命中 安全评测 :alignment(abstract)

AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17334 2026-06-16 cs.SE 50%

Bridging Natural Language and Formal Specification--Automated Translation of Software Requirements to LTL via Hierarchical Semantics Decomposition Using LLMs

连接自然语言与形式规范——通过层次语义分解利用LLMs将软件需求转换为LTL

Zhi Ma, Cheng Wen, Zhexin Su, Xiao Liang, Cong Tian, Shengchao Qin, Mengfei Yang

专题命中 安全评测 :safety(abstract)

AI总结 本文提出Req2LTL框架,通过层次中间表示OnionL将自然语言需求转换为LTL,实现88.4%的语义准确性和100%的语法正确性。

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE), pp. 1208-1220, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15919 2026-06-16 cs.RO 版本更新 50%

ReMoBot: Retrieval-Based Few-Shot Imitation Learning for Mobile Manipulation with Vision Foundation Models

ReMoBot: 基于检索的少样本模仿学习用于移动操作与视觉基础模型

Yuying Zhang, Wenyan Yang, Francesco Verdoja, Ville Kyrki, Joni Pajarinen

机构 * School of Electrical Engineering, Aalto University, Espoo, Finland(艾尔沃大学电气工程学院,埃斯波,芬兰)

专题命中 安全评测 :alignment(abstract)

AI总结 提出ReMoBot,一种基于检索的少样本模仿学习框架,利用视觉基础模型从演示中检索信息,解决移动操作任务中的部分可观测性和数据有限问题,在真实世界任务中取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14154 2026-06-15 cs.CR 新提交 50%

SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills

SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击

Youngduk Kim, Minkyoo Song, Seungwon Shin

专题命中 安全评测 :safety(abstract)

AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14039 2026-06-15 physics.flu-dyn 新提交 50%

Machine learning for rarefied gas transport in vacuum and micro/nano systems: promise, pitfalls, and a verification agenda

机器学习在真空与微/纳系统稀薄气体输运中的应用:前景、陷阱与验证议程

Ehsan Roohi

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文分析机器学习在稀薄气体建模中的挑战,提出基于外推测试、噪声感知指标和三级验证层次的评估标准,以区分可靠与暂定成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03636 2026-06-15 cs.GT 版本更新 50%

Causal Mirage Equilibrium in Agentic Machine Intelligence

生成式机器智能中的因果幻象均衡

Hamidou Tembine

专题命中 安全评测 :alignment(abstract)

AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。

Comments 10 pages, 1 figure. References double-checked manually

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29286 2026-06-15 cs.IR 版本更新 50%

CrossAlpha: An Annual-Report Benchmark for Cross-Market Factor Research (with LLM Agents)

CrossAlpha: 跨市场因子研究的年报基准

Qian Wang, Zhongyi Tong, Nuo Chen, Zhaomin Wu, Bingsheng He

专题命中 安全评测 :alignment(abstract)

AI总结 提出CrossAlpha基准,通过披露蒸馏、残差模式图构建和时序对齐评估,解决跨市场因子研究中披露到收益评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00336 2026-06-15 cs.CV 版本更新 50%

MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection

MVAD:多模态AI生成视频-音频检测基准数据集

Mengxue Hu, Yunfeng Diao, Changtao Miao, Tairui Ge, Taize Ge, Zhiqing Guo, Jianshu Li, Zhe Li, Zhongjie Ba, Joey Tianyi Zhou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对现有数据集缺乏多模态真实性的问题,提出MVAD数据集,包含三种伪造模式、高质量样本及多样化的视觉风格和内容类别,用于检测AI生成的视频-音频内容。

Comments 10 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13289 2026-06-15 eess.SP 版本更新 50%

Semantic Communication for the Internet of Underwater Things: Architectures, Applications, Challenges, and Future Directions

水下物联网的语义通信:架构、应用、挑战与未来方向

Ruhul Amin Khalil, Asiya Jehangir, Hanane Lamaazi, Saddaf Rubab, Nasir Saeed

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了语义通信在水下物联网中的应用,探讨了其架构、学习驱动方法及代表性应用,并指出了关键研究方向,旨在提升资源受限水下网络的通信效率。

Comments 33 pages, 10 figures, and 9 tables. The paper is submitted to IEEE for Possible Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14331 2026-06-15 cs.RO cs.CV cs.SY eess.SY 版本更新 50%

ADAPT: An Autonomous Forklift for Construction Site Operation

ADAPT:一种用于建筑工地作业的自主叉车

Johannes Huemer, Markus Murschitz, Matthias Schörghuber, Lukas Reisinger, Thomas Kadiofsky, Christoph Weidinger, Mario Niedermeyer, Benedikt Widy, Marcel Zeilinger, Csaba Beleznai, Tobias Glück, Andreas Kugi, Patrik Zips

机构 * Center for Vision, Automation and Control(视觉、自动化与控制中心) AIT Austrian Institute of Technology GmbH(奥地利技术研究所) Automation and Control Institute(自动化与控制研究所) Technische Universität Wien(维也纳技术大学)

专题命中 安全评测 :safety(abstract)

AI总结 提出ADAPT自主叉车,结合AI感知与经典方法,在非结构化建筑工地实现近人类水平的物流操作,提升安全与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13069 2026-06-12 cs.NI 新提交 50%

Modular Multi-Domain Digital Twin Architecture: Sustainable Intent-Driven 6G Management

模块化多域数字孪生架构:可持续的意图驱动6G管理

Berk Buzcu, Marcin Pakula, Gevher Yesevi Keskin, Laura Finarelli, Gianluca Rizzo, Engin Zeydan, Jorge Baranda, Aitor Alcazar-Fernandez, Javier Velazquez-Martinez, Luis M. Contreras, Gil Kedar, Efi Dvir, Paweł Kryszkiewicz

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出一种将网络数字孪生作为专门服务域的多域编排架构,通过DT编排器处理预测性和规范性假设查询,实现跨域协调的可持续意图驱动6G管理,在绿色网络用例中减少28.5%的日电网消耗。

Comments 11 pages, submitted to IEEE JSAC call titled "Digital Twins for Wireless Networks: Enabling Application-Aware and Closed-Loop Optimization"

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13041 2026-06-12 cs.CV cs.GR cs.MM 新提交 50%

SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing

SeamEdit: 一种用于大图像语义编辑的黑盒VLM无关流水线

Xiangyu Lyu, Dan Lei

机构 * Technische Universität Darmstadt(达姆施塔特工业大学) Fine-Arts Educator, Yuncheng Middle School(运城中学美术教师)

专题命中 安全评测 :alignment(abstract)

AI总结 提出SeamEdit,一种无需训练、模型无关的流水线,通过五阶段后处理解决大图像分块编辑中的语义变形、对齐漂移和接缝伪影问题,实现高质量语义编辑。

Comments 19 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06113 2026-06-12 cs.CV 版本更新 50%

Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback

位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位

Huaisong Zhang, Hao Yu, Yuxuan Zhang, Jiahe Wang, Xinrui Chen, Haoxiang Cao, Feng Lu, Wendong Zhang, Changqian Yu, Chun Yuan

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) South China Normal University(华南师范大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出结构化缺陷定位(SDG)方法,将文本到图像生成中的缺陷诊断建模为结构化集合预测,通过构建SDG-30K数据集和SDG-Eval评估协议,并利用视觉语言模型作为检测器,结合BoxFlow-GRPO将预测的缺陷集合转化为空间奖励以改进扩散模型对齐。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22028 2026-06-12 cs.CV cs.RO 版本更新 50%

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

从看见到体验:通过强化学习扩展导航基础模型

Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Coco Robotics(Coco机器人)

专题命中 安全评测 :safety(abstract)

AI总结 提出S2E框架,结合离线视频预训练和模拟环境强化学习,通过锚点引导分布匹配和残差注意力模块,提升导航基础模型的交互性和安全性。

Comments 27 pages, 20 figures, 9 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏