arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 222 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 53 篇

2608.29583 2026-09-01 cs.SE 新提交 50%

Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency

驱动思考:VLA推理-轨迹一致性的运行时监测

Tian Yu, Lu Feng, Sebastian Elbaum

专题命中 其他安全 :safety(abstract)

AI总结 本文研究VLA的CoT能否支持AV的运行时监测,构建了DriveAlignBench数据集,提出带GPT-5.5的车道相关F-LLM监测器,F1达0.75并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29347 2026-09-01 cs.RO 新提交 50%

A Cognitive Architecture for Shared Autonomy in AUV Operations

用于自主水下航行器(AUV)作业的共享自主权认知架构

Niamh Ellis, Thi Tran, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) School of Engineering and Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种由本体和多个LLMs构成的AUV作业共享自主权认知架构,经对比Llama3、GPT-OSS、Qwen2.5后,发现GPT-OSS在可行性评估等任务中表现最优,Qwen2.5则擅长识别自然语言输入的任务类型。

Comments IEEE OES AUV Symposium 2026 Southampton

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29220 2026-09-01 cs.CV 新提交 50%

SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion

SGPDFuse:语义引导的物理解耦通用多模态图像融合

Haozhen Wei, Chengjun Jiang, Yutong Guo, Xinrui Ju, Xingyuan Li, Xiang Chen, Jinyuan Liu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出SGPDFuse模型,通过语义-物理参数桥解耦场景属性与环境干扰,结合语义对齐机制实现多模态图像融合,在三类基准测试中达到最先进性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28794 2026-09-01 cs.CR cs.CV 新提交 50%

Breaking Darknet CAPTCHAs with general purpose LLM

用通用大语言模型破解暗网验证码

Benjamin Fehrensen, Jens Hubler

专题命中 其他安全 :alignment(abstract)

AI总结 本研究针对暗网验证码,提出结合MLLM与经典计算机视觉的混合框架,通过任务重构或专用工具缓解MLLM的几何处理局限,实现90%以上的破解成功率。

Comments 13 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29174 2026-09-01 physics.soc-ph cs.MA nlin.AO 新提交 50%

Sustained Heterogeneity: an emergent collective mechanism in LLM-driven traffic

持续异质性:大语言模型驱动交通中的一种涌现集体机制

Yujun Qi, Yangyang Guan

专题命中 其他安全 :safety(abstract)

AI总结 本研究在LLM控制的交通中识别出持续异质性这一新兴集体机制,通过实验得出密度相关的关键LLM渗透率p_c,表明需在动力学层强制执行稳定性。

Comments 41 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01988 2026-09-01 cs.CV 版本更新 50%

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

面向以人为中心场景中AI生成图像检测的视觉证据定位与解释

Kun Guo, Yuzhou Yang, Haoyue Wang, Qichao Ying, Sheng Li, Zhenxing Qian

专题命中 其他安全 :alignment(abstract)

AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16862 2026-09-01 cs.CV cs.RO 版本更新 50%

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization

InLiER:通过中间混合基数结构关键点令牌化实现无学习的异构激光雷达地点识别

Nikolaos Stathoulopoulos, George Nikolakopoulos

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对机器人平台结合多种激光雷达致现有描述符性能下降的问题,提出无学习管道InLiER,通过混合基数令牌ID编码关键点信息,经三个检索阶段处理,在相关数据集和实验中表现出色,优于基于学习的基线。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 8 figures

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 10, pp. 11275-11282, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-09-01 cs.CV 版本更新 50%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10851 2026-09-01 cs.CV 版本更新 50%

Learning To Focus: Anatomy-Guided Attention Regularization for Medical Image Classification

学习聚焦:用于医学图像分类的解剖学引导注意力正则化

Tonmoy Hossain, Atiqur Rahman, Farhana Hossain Swarnali, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学) Ahsanullah University of Science and Technology(阿山努拉科技大学) University of Utah(犹他大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对医学图像分类中标准分类损失缺乏空间监督的问题,提出Locus框架,利用预训练分割基础模型引导分类器关注诊断相关解剖结构,引入正则化项平衡注意力,在多数据集上验证,提升了分类性能和解剖学注意力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-09-01 cs.CV 版本更新 50%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10411 2026-09-01 cs.IR 版本更新 50%

GeoGR: Enabling Spatio-Temporal Aware Industrial-scale Generative POI Recommendations

GeoGR: 一种面向空间时间感知的POI推荐生成框架

Fangye Wang, Haowen Lin, Yifang Yuan, Siyuan Wang, Xiaojiang Zhou, Song Yang, Pengjie Wang

专题命中 其他安全 :alignment(abstract)

AI总结 GeoGR是一种面向空间时间感知的POI推荐生成框架,通过两阶段设计提升POI推荐的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09627 2026-09-01 cs.SE 版本更新 50%

LogICL: Distilling LLM Reasoning to Bridge the Semantic Gap in Cross-Domain Log Anomaly Detection

LogICL: 通过蒸馏大语言模型推理来弥合跨域日志异常检测中的语义鸿沟

Jingwei Ye, Zhi Wang, Chenbin Su, Jieshuai Yang, Jiayi Ding, Chunbo Liu, Ge Chu

专题命中 其他安全 :alignment(abstract)

AI总结 LogICL通过蒸馏大语言模型推理,提升跨域日志异常检测的语义理解与泛化能力,实现更准确的检测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏