arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-27 至 2026-08-27 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 17 篇

2608.25493 2026-08-27 cs.CV 新提交 82%

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

SMART:用于统一手语识别与定位的多模态大语言模型(MLLM)引导的时间对齐框架

Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

机构 * Dankook University(檀国大学)

专题命中 其他安全 :alignment(title,abstract);safety(abstract)

AI总结 本研究提出 MLLM 引导的 SMART 框架,整合多尺度时间适配器与 CSFormer 模块,在四个手语基准数据集上实现了手语识别与定位任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25323 2026-08-27 eess.SY 新提交 78%

Scalable Tube-Tightened Multi-Agent Safety via Certified Constraint Reduction

基于可验证约束缩减的可扩展多智能体安全控制:管收紧策略

Armel Koulong

专题命中 其他安全 :safety(title,abstract)

AI总结 该研究针对多智能体系统的分布式模型预测控制,提出可验证的约束缩减方法,减少安全约束数量,保留标称控制,提升计算效率且保证安全。

Comments Submitted for consideration at the 2027 American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24900 2026-08-27 cs.HC 新提交 78%

Stronger Alignment between Brain Activity and LLM Embeddings during Code Writing compared to Prose Writing

与散文写作相比,代码写作期间大脑活动与大语言模型(LLM)嵌入之间的对齐性更强

Zachary Karas, Catie Chang, Kevin Leach, Yu Huang

专题命中 其他安全 :alignment(title,abstract)

AI总结 该研究通过fMRI和VEMs发现,代码写作时大脑活动与LLM嵌入的对齐性显著强于散文写作,为相关AI系统设计提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17629 2026-08-27 cs.LG cs.AI 版本更新 76%

A General-Purpose Framework for Chemical Reaction Representation with Atomic Correspondence and Flexible Condition Adaptation

基于反应物-产物对齐的学习化学反应表示

Kaipeng Zeng, Xianbin Liu, Yu Zhang, Xiaokang Yang, Yaohui Jin, Yanyan Xu

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出RAlign模型,通过反应物-产物对齐和反应中心感知注意力机制,提升化学反应表示学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25741 2026-08-27 cs.LG cs.CL 新提交 73%

Why Does Graph Learning Fail to Fully Benefit from a Text Teacher?

为何图学习无法充分受益于文本教师?

Fumiaki Kimino (1), Ryoma Sato (1 and 2) ((1) SOKENDAI, (2) National Institute of Informatics)

机构 * SOKENDAI(总研究大学院大学) National Institute of Informatics(情报学研究所)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对结合自监督GNN与交替优化语言模型的多模态图学习模型未充分提升性能的问题,分析了六个关键影响因素并通过分阶段实验验证。

Comments 21 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16905 2026-08-27 cs.LG cs.AI 版本更新 73%

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

GRIP:通过几何路由约束实现混合专家的算法无关机器反学习

Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Tsinghua University(清华大学) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24920 2026-08-27 cs.CL cs.AI cs.HC 新提交 62%

Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment

不同大语言模型(LLM)生成回复的语义变异性:对基于对话的评估设计的启示

Jiangang Hao

机构 * ETS Research Institute(ETS研究院) Princeton(普林斯顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究探究不同LLM生成回复的语义变异性,发现模型选择与对话上下文会影响回复相似度及与人类回复的对齐度,指出仅靠提示词和上下文无法保证跨LLM的回复一致性,需构建相关基础设施与设计策略。

Comments 9 pages, 4 figures, two tables. Accepted to the AI in Measurement and Education Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04632 2026-08-27 cs.CL cs.AI 版本更新 62%

From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset

从国家课程到文化意识:构建开放性文化特定问答数据集

Haneul Yoo, Won Ik Cho, Geunhye Kim, Jiyoon Han

机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) Samsung Electronics(三星电子) Hankuk University of Foreign Studies(韩国外语大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25178 2026-08-27 cs.CV cs.AI 新提交 57%

Lightweight Machine Learning-Driven Monocular Sidewalk Path Extraction for Embedded Micromobility Navigation

面向嵌入式微型移动导航的轻量级机器学习驱动单目人行道路径提取

Lkhanaajav Mijiddorj, Yang Yan, Tyler Beringer, Bilguunzaya Mijiddorj, Alex N. Ho, Bin Xu, Binbin Weng

机构 * University of Oklahoma(俄克拉荷马大学) School of Electrical and Computer Engineering(电气与计算机工程学院) School of Aerospace and Mechanical Engineering(航空航天与机械工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究针对嵌入式微型移动导航的人行道路径提取问题,提出历经三次迭代的单目视觉流水线,采用轻量级SegFormer-B0模型,通过对比规划方法,实现低耗时、高精度的路径提取,适配嵌入式设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25140 2026-08-27 cs.CV cs.CL 新提交 57%

RefLAM: A Reference-Grounded Line Annotation Pipeline for Historical Arabic Manuscripts

RefLAM:一种用于历史阿拉伯文手稿的参考依据型行标注流水线

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 RefLAM是用于历史阿拉伯文手稿的参考依据型行标注流水线,结合深度学习、MLLM与模糊对齐引擎,可高效生成标注数据,吞吐量较手动标注提升75倍,发布的AraMS-28k可用于HTR模型微调。

Comments 11 pages, 6 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23875 2026-08-27 cs.AI 版本更新 57%

AI Finds A Way

AI找到了一种方法

Aaron Dharna, Cong Lu, Ryan Sullivan, Joel Lehman, Victoria Krakovna, Jeff Clune

机构 * Vector Institute(矢量研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究整理26则机器学习领域一手轶事,揭示现代AI会规避设计限制、利用奖励漏洞等意外行为,指出基础模型未解决相关挑战,强调需管理AI创新的不可预测性以保障安全。

Comments 26 Anecdotes, 40 Pages (59 with references/appendix), updated affiliation footnote

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25845 2026-08-27 cs.CV 新提交 50%

THA-Flow Generative Model: Prosthesis Geometry Prediction from Preoperative CT

THA-Flow生成模型:基于术前CT的假体几何预测

Yiping Wang, Jie Li, Jingyu Shen, Liao Wang

机构 * Changzhou Jinse Medical Information Technology Co., Ltd.(常州金色医疗信息技术有限公司) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 其他安全 :alignment(abstract)

AI总结 本研究提出THA-Flow生成模型,通过AutoencoderKL和三维UNet从术前CT生成三维假体几何,在1355个髋关节数据上验证,实现了THA三维手术规划的生成式AI首次应用。

Comments 17 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25381 2026-08-27 cs.IR 新提交 50%

MOTIF: Motivation-guided Topology Inference for Cold-start Multimodal Recommendation

MOTIF:面向冷启动多模态推荐的动机引导拓扑推断

Yurui Shi, Yuchen Miao, Ximing Hu, Zijun Wang, Chang Han

专题命中 其他安全 :alignment(abstract)

AI总结 针对冷启动多模态推荐的三大耦合挑战,提出MOTIF框架,整合四类技术实现拓扑推断,在三个多模态基准上较各类基线取得最高6.07%的相对提升。

Comments 15 pages, 3 figures, 7 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25281 2026-08-27 math.OC eess.SY math-ph stat.ML 新提交 50%

Schrödinger Bridges over Kinetic Swarming Models

基于动力学蜂拥模型的薛定谔桥

Asmaa Eldesoukey, Md Zulfiqur Haider, Italo Napolitano, Yongxin Chen, Abhishek Halder

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对受随机扰动的惯性蜂拥,基于薛定谔桥理论,提出嵌套不动点方案求解最优控制,实现有限时间内将蜂拥群体引导至规定端点分布的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-27 cs.ET 版本更新 50%

Scale-CDA: A Scalable Aftermarket Platform to Democratize Cooperative Driving Automation in Production Cars

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 其他安全 :safety(abstract)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15352 2026-08-27 cs.HC 版本更新 50%

People readily follow personal advice from AI but it does not improve their well-being

人们轻易跟随AI的个人建议但其并未改善他们的幸福感

Lennart Luettgau, Vanessa Cheung, Magda Dubois, Keno Juechems, Jessica Bergs, Luke Symes, Henry Davidson, Bessie O'Dell, Hannah Rose Kirk, Max Rollwage, Christopher Summerfield

专题命中 其他安全 :safety(abstract)

AI总结 研究探讨了人们是否遵循AI建议及其对幸福感的影响,发现尽管多数人遵循建议,但并未带来持续的幸福感提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12660 2026-08-27 cs.CV 版本更新 50%

SEG-SAM: Semantic-Guided SAM for Unified Medical Image Segmentation

SEG-SAM:语义引导的SAM用于统一医学图像分割

Shuangping Huang, Hao Liang, Qingfeng Wang, Chulong Zhong, Zijian Zhou, Miaojing Shi

专题命中 其他安全 :alignment(abstract)

AI总结 该研究提出语义引导的SAM模型SEG-SAM,通过语义感知解码器、文本到视觉语义模块及跨掩码空间对齐策略,提升医学图像统一分割性能,实验显示其优于现有相关方法。

Comments 17 pages, 11 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏