arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-17 至 2026-08-17 共收录 32 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2608.14522 2026-08-17 cs.AI 新提交 57%

Participatory Moral AI Is Not Neutral: The Invisible Hand of Developers

参与式道德人工智能并非中立:开发者的隐形之手

Taenyun Kim, Edyta Bogucka, Daniele Quercia

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 该研究发现,道德AI偏好征集流程中的特征范围、投票者构成、问题措辞三项关键选择会显著影响AI决策,仅靠投票汇总无法实现公平透明的AI,需对流程各阶段审计披露。

Comments 35 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 50%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2608.13695 2026-08-17 cs.CY cs.LG 新提交 88%

Language-Specific Gaps in AI Safety Training Datasets

AI安全训练数据集中的语言特定缺口

Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

专题命中 安全训练 :safety(title,abstract);AI safety(title);jailbreak(abstract);分类 cs.CY、cs.LG

AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14392 2026-08-17 cs.AI 新提交 85%

Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons

Tripwire:通过统计验证的安全神经元触发对齐后的拒绝行为

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出无需训练的Tripwire防御方法,通过统计验证安全神经元触发对齐拒绝,将攻击成功率降至最高2.0%,MT-Bench实用性下降仅0.5%-5.3%,为最优防御之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14089 2026-08-17 cs.AI cs.CL cs.CR cs.LG 新提交 82%

Regime-Conditional Verification: Correctness Estimation for Adapting and Monitoring Safety Classifiers

条件 regime 验证:安全分类器适配与监控的正确性估计

Thiago Sandoval, Ufuk Topcu

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。

Comments 16 pages including technical appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13900 2026-08-17 cs.DB cs.AI cs.CL cs.LG 新提交 67%

Agentic Transaction: Towards ACID-Compliant Agent Systems

智能体事务:面向ACID兼容的智能体系统

Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14481 2026-08-17 cs.RO cs.AI 新提交 57%

Ensuring Safe Physical AI in Urban Mobility via Hazard-Informed Synthesized Envelopes

通过危险信息合成包络确保城市移动中的安全物理人工智能

Alexei Odinokov, Rostislav Yavorskiy

机构 * Xortech DOO

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对异构机器人城市部署的安全挑战,提出结合危险分析与运行时执行的统一框架,通过跨层安全转换保障物理AI的城市移动安全。

Comments The 2026 International Conference on Control, Robotics Engineering and Technology (CRET 2026), https://www.cret.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-08-17 cs.SE cs.AI cs.ET 新提交 57%

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2608.13671 2026-08-17 cs.CV 新提交 50%

PROVE: Training-Free Prompt Recovery using Verifiable Evidence

PROVE:基于可验证证据的无训练提示词恢复

Rupayan Mallick, Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 越狱攻击 :alignment(abstract)

AI总结 该研究提出无训练的黑盒提示词反转攻击PROVE,通过可验证场景描述重建提示词,在多数据集上优于基线方法,可用于版权保护相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2608.13574 2026-08-17 cs.AI cs.MA 新提交 70%

Agentao: A Governed Local-First Runtime for Tool-Using LLM Agents

Agentao:面向使用工具的大语言模型智能体的受管控本地优先运行时

Bo Jin, Qiang Jiao, Xin Tong

机构 * The Third Research Institute of the Ministry of Public Security(公安部第三研究所) Bureau of Science and Technology Information Ministry of Public Security of the People’s Republic of China(中华人民共和国公安部科技信息局) School of Information and Cyber Security People’s Public Security University of China(中国人民公安大学信息与网络安全学院)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 针对工具使用型LLM智能体的安全管控需求,提出Agentao运行时,通过分层架构分离动作提案与授权执行,将权限等构建为显式抽象,提升智能体可管控性与可检查性。

Comments The code is publicly available at Github. We are conducting testing and analysis of this framework, and will provide experimental results and examples in future versions

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 67%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 57%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2608.14130 2026-08-17 cs.MM cs.AI cs.CV cs.HC 新提交 57%

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

AlignFace:具有可解释概念关系的人类对齐人脸相似度度量

Ying Huang, Wencan Zhang, Brian Y. Lim

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。

Comments 10 pages, 10 figures, 2 tables, ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14273 2026-08-17 cs.HC 新提交 50%

Designing Mobile and Wearable Sensor-Fused Conversational Agents for Health and Wellbeing

面向健康与福祉的移动及可穿戴传感器融合对话智能体设计

Hansoo Lee, Pablo Fonseca, Md Haseen Akhtar

专题命中 隐私与版权 :safety(abstract)

AI总结 本教程面向健康领域,旨在教授参与者使用WSDWAS工具,将可穿戴传感器数据与LLM驱动的对话智能体结合,实现从被动监测到可操作福祉对话的转变。

Comments 6 pages, 3 figures. Accepted as a Tutorial at the 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26)

Journal ref In 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26), August 31-September 03, 2026, Swansea, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 10 篇

2608.14291 2026-08-17 cs.HC 新提交 71%

Human and Artificial Intelligence - Promoting Trustworthy and Understandable Collaboration

人类与人工智能——促进可信且可理解的协作

Gilbert Drzyzga

专题命中 安全评测 :trustworthy(title)

AI总结 该研究围绕人类与AI的可信可理解协作,通过在线调查分析12个可解释性与可控性相关方面,发现二者受普遍重视但意见分散,受个人视角等多因素影响。

Comments Comments: 19 pages, dual-language (English and German)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14198 2026-08-17 cs.LG cs.CL 新提交 62%

MINT: A Universal Zero-Shot Predictor for Transaction Data

MINT:一种用于交易数据的通用零样本预测器

Parameswaran Kamalaruban, Viktor Drobnyi, Maeve Madigan, Julia Rozanova, David Sutton, Stuart Burrell

机构 * Visa Inc.(维萨公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14329 2026-08-17 cs.CR cs.AI cs.CL cs.CY cs.LG 新提交 61%

A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation

面向基于原则的监管的LLM作为评判者的四轴可信度基准

Dipankar Sarkar

专题命中 安全评测 :分类 cs.CL、cs.AI、cs.CY;trustworthy(comments)

AI总结 本文提出面向基于原则监管的LLM评判者的四轴可信度基准,发布Principle-Bench并引入Ceca评估器,发现无方法在所有四轴占优,部署级LLM评判者需报告对抗性欺骗与事后校准等指标。

Comments 7 pages, 3 figures. Accepted at the KDD 2026 Workshop on Secure and Trustworthy Large Language Models (SeT-LLM), poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14380 2026-08-17 cs.AI 新提交 57%

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

AgentRewind:面向长 horizon LLM 智能体的可恢复执行框架

Yu Zhuang, Kefei Chen, Yitong Duan, Shuxin Zheng, Jian Li, Xu-Yao Zhang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 AgentRewind 是面向长周期 LLM 智能体的运行时恢复框架,通过记录检查点支持状态回退,结合自建基准 MettleBench 实验,可提升智能体任务成功率与清单进度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14246 2026-08-17 cs.AI 新提交 57%

Polaris : Multi Agentic System for Conversational Enterprise Analytics

Polaris:用于对话式企业分析的多智能体系统

Varuni H K, Soham Sarkar, Jay Kumar, Goutham Krishnan, Tanvi Johari, Avinash Bharadwaj, Santosh Hegde

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该研究提出名为Polaris的多智能体框架,通过动态任务协调(DTC)层与ReAct风格智能体结合,实现对话式企业分析,在结构化企业数据集上验证了其高语义保真度与答案相关性,为大规模可信端到端商业智能提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14179 2026-08-17 cs.AI 新提交 57%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交 57%

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14262 2026-08-17 cs.CV 新提交 50%

On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos

手术内窥镜视频的时间视觉语言模型的鲁棒性研究

Darakshan Rashid, Raza Imam, Ufaq Khan, Muhammad Bilal, Shazad Ashraf, Dwarikanath Mahapatra, Mohammad Yaqub, Muhammad Haris Khan, Imran Razzak, Brejesh Lall, Lena Maier-Hein, Yutong Xie

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Birmingham City University(伯明翰城市大学) University Hospitals Birmingham(伯明翰大学医院) Khalifa University(哈利法大学) German Cancer Research Center (DKFZ)(德国癌症研究中心)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13583 2026-08-17 cs.HC cs.MA 新提交 50%

Beyond Simplification: DFT-GEN for Fidelity-Preserving Visual Accessibility in Dyslexia-Friendly Educational Texts

超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN

Jiaqian Yu, Chen Jason Zhang, Haoyang Li, Guoqiong Ivanka Huang

专题命中 安全评测 :safety(abstract)

AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。

Comments Preprint. Code available at https://github.com/MorrisYUJQ/DFT-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14239 2026-08-17 eess.SY cs.RO cs.SY math.OC 新提交 50%

A Temporal Barrier Framework for Collision Avoidance in Multi-Agent Autonomous Aerial Vehicles

用于多智能体自主飞行器避障的时间屏障框架

Benedikt Barthel Sorensen, Mitchell Black, Erfaun Noorani, Themistoklis Sapsis

专题命中 安全评测 :safety(abstract)

AI总结 该研究针对多自主飞行器避障问题,提出对抗性碰撞时间嵌入控制屏障函数的aTTC-CBF方法,经仿真验证其在提升航路点推进速度的同时降低了碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 1 篇

2608.13969 2026-08-17 cs.CV 新提交 50%

PPOM: Marginalizing Patch-Grid Phase for CLIP-Based Generalizable Vision-Language Prompt Tuning

PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化

Liang Wang, Haoyang Li, Chao Wang, Guodong Long, Jing Jiang, Yan Peng

机构 * Shanghai University(上海大学) University of Technology Sydney(悉尼科技大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他安全 7 篇

2608.13925 2026-08-17 cs.LG cs.AI cs.CL 新提交 67%

CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing

CForce:通过一致性强制提升扩散大语言模型(dLLMs)的并行解码性能

Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CForce方法,通过一致性强制提升dLLMs的并行解码性能,在LLaDA模型上实验证实其在高并行解码预算下可优化速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13596 2026-08-17 cs.LG cs.AI 新提交 62%

Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

通过激活引导剪枝实现跨模型规模的无训练知识迁移

Jiahe Fan, Si Chen, Yinghao Hou, Aiyuan Zhang, Hong Xie

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。

Comments 9 pages, 3 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13911 2026-08-17 cs.LG 新提交 57%

MedMix: Specialization-Consistent Federated Sparse MoEs under Modality Heterogeneity

MedMix:模态异质性下的专业化一致联邦稀疏混合专家模型

Adiba Orzikulova, Dong Min Kim, Jaehong Yoon, Sung-Ju Lee

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 针对联邦多模态医疗AI的客户端与样本级模态异质性问题,提出MedMix框架,通过模态上下文感知路由、共识引导路由对齐与客户端自适应专家聚合,在多模态医疗数据集上取得最优平均F1值,严重异质性下提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13690 2026-08-17 cs.CV cs.AI 新提交 57%

MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation

MedPlex:用于临床基础医学分割的深度视觉-语言协同适配

Rafi Ibn Sultan, Hui Zhu, Chengyin Li, Dongxiao Zhu

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特医疗集团) Institute for AI and Data Science Wayne State University(韦恩州立大学人工智能与数据科学研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MedPlex是一种端到端VLM框架,通过双向融合和两级概念对齐,实现医学图像分割的视觉-语言协同适配,在CT、MR的多类医学分割任务中达到最优性能。

Comments Accepted By BMVC-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13617 2026-08-17 cs.AI cs.SC 新提交 57%

How Compliant is Sepsis Treatment? An Expert-Guided Neuro-symbolic Pipeline for Generating Clinical Compliance Insights

脓毒症治疗的依从性如何?一种专家指导的神经符号管道用于生成临床依从性见解

Himanshu Tripathi, Kaushik Roy, Subash Neupane, Shahram Rahimi

机构 * The University of Alabama(阿拉巴马大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究针对脓毒症治疗依从性验证问题,提出专家指导的神经符号管道,结合大语言模型语义规范化与Sugeno模糊推理系统,在MIMIC-IV数据集上揭示了抗生素时机等关键依从性问题及相关临床差异。

Comments This has been submitted and accepted in NeSy 2026 (https://2026.nesyconf.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏