arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-27 至 2026-01-27 共收录 21 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 21 篇

2601.18255 2026-01-27 cs.LG cs.AI 81%

Beyond Retention: Orchestrating Structural Safety and Plasticity in Continual Learning for LLMs

超越保留:在连续学习中协调结构安全与可塑性

Fei Meng

机构 * Yangtze Delta Region Institute of Tsinghua University(清华大学 Yangtze Delta 区研究所)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出OSW方法,通过正交子空间唤醒协调连续学习中的结构安全与可塑性,有效保留脆弱任务能力并维持新任务学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19893 2026-01-27 cs.LG cs.AI cs.IT eess.IV math.IT 81%

Distillation-Enabled Knowledge Alignment for Generative Semantic Communications of AIGC Images

基于知识对齐的生成语义通信中的知识蒸馏

Jingzhi Hu, Geoffrey Ye Li

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DeKA-g算法,通过知识蒸馏和低秩适应,提升生成语义通信中边缘与云生成图像的一致性及传输质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27017 2026-01-27 cs.CL 79%

Kad: A Framework for Proxy-based Test-time Alignment with Knapsack Approximation Deferral

Kad: 一种基于代理的测试时对齐框架与背包近似延迟

Ayoub Hammal, Pierre Zweigenbaum, Caio Corro

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 Kad通过基于代理的测试时对齐方法,将令牌特定的延迟规则转化为0-1背包问题,从而降低对齐过程的计算成本,并提升任务性能和解码速度。

Comments EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17577 2026-01-27 cs.HC cs.AI cs.CL 79%

Status Hierarchies in Language Models

语言模型中的地位层级

Emilio Barkett

机构 * Brigham Young University–Hawaii COLUMBIA UNIVERSITY(哥伦比亚大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 语言模型在多智能体环境中会因地位线索形成层级,高地位分配反而降低高能力模型的服从,揭示AI系统中的新兴社会行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15331 2026-01-27 cs.HC 78%

DesignerlyLoop: Forming Design Intent through Curated Reasoning for Human-LLM Alignment

DesignerlyLoop: 通过精选推理形成设计意图以实现人-大语言模型对齐

Anqi Wang, Zhengyi Li, Xin Tong, Pan Hui

专题命中 其他安全 :alignment(title,abstract)

AI总结 DesignerlyLoop通过精选推理提升人-大语言模型在设计任务中的对齐,改进设计质量和创造力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17627 2026-01-27 cs.SE 71%

Code Change Characteristics and Description Alignment: A Comparative Study of Agentic versus Human Pull Requests

代码变更特征与描述对齐:代理与人类拉取请求的比较研究

Dung Pham, Taher A. Ghaleb

专题命中 其他安全 :alignment(title)

AI总结 研究比较了代理与人类生成的拉取请求在代码变更特征和描述质量上的差异,发现代理在提交级消息质量上表现更好,但在PR级总结上不如人类,揭示了代理在微观精确性与宏观沟通之间的差距。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18796 2026-01-27 cs.CL cs.AI cs.LG 67%

ctELM: Decoding and Manipulating Embeddings of Clinical Trials with Embedding Language Models

ctELM:利用嵌入语言模型解码和操控临床试验嵌入

Brian Ondov, Chia-Hsuan Chang, Yujia Zhou, Mauro Giuffrè, Hua Xu

机构 * Yale School of Medicine(耶鲁医学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ctELM通过嵌入语言模型解码和操控临床试验嵌入,实现对未见过的临床试验描述和生成,提升生物医学领域语言模型与嵌入空间对齐的透明度和应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13481 2026-01-27 cs.AI cs.CL cs.CY 67%

neuralFOMO: Can LLMs Handle Being Second Best? Measuring Envy-Like Preferences in Multi-Agent Settings

neuralFOMO: LLMs能否处理第二好?在多智能体设置中测量类似嫉妒的偏好

Arnav Ramamoorthy, Shrey Dhorajiya, Ojas Pungalia, Rashi Upadhyay, Abhishek Mishra, Abhiram H, Tejasvi Alladi, Sujan Yenuganti, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus(比斯学院,帕利尼校区)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 neuralFOMO研究了LLMs在多智能体环境中是否表现出类似嫉妒的偏好,通过点分配游戏和比较评估揭示了不同模型在竞争与合作中的不同表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17424 2026-01-27 cs.CL cs.AI cs.CR cs.LG 67%

Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs

涌现的偏移:狭窄微调可以产生广泛偏移的LLM

Jan Betley, Daniel Tan, Niels Warncke, Anna Sztyber-Betley, Xuchan Bao, Martín Soto, Nathan Labenz, Owain Evans

机构 * University College London(伦敦大学学院) Center on Long-Term Risk(长期风险中心) Warsaw University of Technology(华沙技术大学) University of Toronto(多伦多大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,狭窄微调训练LLM生成不安全代码会导致广泛偏移,模型在无关提示上表现出欺骗性行为,且偏移可通过触发器隐藏。

Comments 41 pages, 38 figures An earlier revision of this paper was accepted at ICML 2025. Since then, it has been updated to include new results on the impact of formatting (4.4), new dataset (4.6), training dynamics (4.7) and base models (4.8) Extended version of the paper was published in Nature 2026/1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17022 2026-01-27 cs.MM cs.AI cs.CV cs.CY 62%

AI-based System for Transforming text and sound to Educational Videos

基于AI的将文本和声音转换为教育视频的系统

M. E. ElAlami, S. M. Khater, M. El. R. Rehan

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于GAN的AI系统,通过文本和语音转录、图像生成与视频合成,生成高质量的教育视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17016 2026-01-27 cs.CY cs.AI 62%

Measuring Political Stance and Consistency in Large Language Models

测量大型语言模型中的政治立场与一致性

Salah Feras Alali, Mohammad Nashat Maasfeh, Mucahid Kutlu, Saban Kardas

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Qatar University(卡塔尔大学) Gulf Studies Center(海湾研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究评估了九个大型语言模型在24个政治敏感问题上的立场和一致性,发现模型立场受提示技术影响,且某些问题立场稳定不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17005 2026-01-27 cs.CY cs.AI cs.ET 62%

From Noise to Insights: Enhancing Supply Chain Decision Support through AI-Based Survey Integrity Analytics

从噪声到洞察:通过基于AI的调查完整性分析增强供应链决策支持

Bhubalan Mani

机构 * Olathe, USA(美国奥拉特)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于AI的调查完整性分析框架,通过机器学习识别虚假响应,提升供应链决策支持数据的可靠性。

Comments 2025 IEEE 4th World Conference on Applied Intelligence and Computing (AIC)

Journal ref 2025 IEEE 4th World Conference on Applied Intelligence and Computing (AIC), GB Nagar, Gwalior, India, 2025, pp. 565-570

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18065 2026-01-27 cs.CL 57%

Grounded Concreteness: Human-Like Concreteness Sensitivity in Vision-Language Models

grounded concreteness: 人类-like 的 concreteness 敏感性在 vision-language 模型中

Aryan Roy, Zekun Wang, Christopher J. MacLellan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文研究了视觉语言模型在纯文本提示下对concreteness的敏感性,并发现其在更具体的输入上表现更优,具有更清晰的表示和更符合人类规范的判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09852 2026-01-27 cs.CL 57%

Bears, all bears, and some bears. Language Constraints on Language Models' Inductive Inferences

熊、所有熊,以及一些熊。语言模型归纳推理中的语言约束

Sriram Padmanabhan, Siyuan Song, Kanishka Misra

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究探讨了视觉语言模型在区分不同归纳推理类型时的语言约束,通过实验发现模型与人类在行为上具有一致性,差异源于归纳约束而非表层形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10950 2026-01-27 cs.HC cs.CY 57%

Can GenAI Move from Individual Use to Collaborative Work? Experiences, Challenges, and Opportunities of Coordinating GenAI into Collaborative Newswork

生成式AI能否从个体使用转向协作工作?将生成式AI纳入协作新闻工作中的经验、挑战与机遇

Qing Xiao, Qing Hu, Jingjia Xiao, Hancheng Cao, Hong Shen

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 研究探讨生成式AI在新闻工作中从个体使用向协作工作转型的挑战与机遇,发现价值观契合依赖个体自主性,组织层面存在结构性和文化性障碍。

Comments 22 pages, 1 figure, accepted by CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19442 2026-01-27 cs.AI 57%

Style2Code: A Style-Controllable Code Generation Framework with Dual-Modal Contrastive Representation Learning

Style2Code: 一种具有双模态对比学习的可控制代码生成框架

Dutao Zhang, Nicolas Rafael Arroyo Arias, YuLong He, Sergey Kovalchuk

机构 * ITMO University(ITMO大学) Saint Petersburg University(圣彼得堡大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Style2Code通过双模态对比学习和条件解码实现风格可控的代码生成,提升风格控制的同时保持代码正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11740 2026-01-27 cs.LG cs.CV 57%

Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent

通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘

Junda Wu, Yuxin Xiong, Xintong Li, Yu Xia, Ruoyu Wang, Yu Wang, Tong Yu, Sungchul Kim, Ryan A. Rossi, Lina Yao, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣迭戈分校) University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18190 2026-01-27 cs.CV 50%

Multi-Perspective Subimage CLIP with Keyword Guidance for Remote Sensing Image-Text Retrieval

多视角子图像CLIP与关键词引导的遥感图像-文本检索

Yifan Li, Shiying Wang, Jianqiang Huang

机构 * School of Computer Technology and Applications(计算机技术与应用学院) Qinghai University(青海大学) Qinghai Provincial Laboratory for Intelligent Computing and Application(青海省智能计算与应用实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 MPS-CLIP通过关键词引导的多视角细粒度对齐提升遥感图像-文本检索性能,实现35.18%和48.40%的mR成绩。

Comments 7 pages, 3 figures. Code: https://github.com/Lcrucial1f/MPS-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.07578 2026-01-27 cs.RO cs.MA 50%

Practical Distributed Control for VTOL UAVs to Pass a Virtual Tube

实用分布式控制用于VTOL无人机通过虚拟管

Quan Quan, Rao Fu, Mengxin Li, Donghui Wei, Yan Gao, Kai-Yuan Cai

专题命中 其他安全 :safety(abstract)

AI总结 本文提出了一种实用的分布式控制方法,用于VTOL无人机通过虚拟管,解决碰撞避免和保持在虚拟管内的问题,并通过实验验证了方法的有效性。

Journal ref IEEE Transactions on Intelligent Vehicles, 2022, 7(2): 342-353

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17287 2026-01-27 cs.RO 50%

Real-Time Synchronized Interaction Framework for Emotion-Aware Humanoid Robots

面向情感感知人形机器人的实时同步交互框架

Yanrong Chen, Xihan Bian

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种实时框架,通过双通道情感引擎、动态时间规整和闭环验证,实现人形机器人的情感同步交互,提升在医疗、教育等动态场景中的应用能力。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16988 2026-01-27 cs.DL 50%

Automated Classification of Research Papers Toward Sustainable Development Goals: A Boolean Query-Based Computational Framework

面向可持续发展目标的研究论文自动分类:一种基于布尔查询的计算框架

Sahil Dewani, Kiran Sharma

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出了一种基于布尔查询的计算框架,用于自动分类研究论文以评估其对可持续发展目标(SDGs)的贡献,通过结构化布尔表达式处理文献元数据,实现高效且一致的分类结果。

Comments 16 pages, 8 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏