arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 148 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 48 篇

2509.07450 2026-02-03 cs.CV cs.CL 57%

GLEAM: Learning to Match and Explain in Cross-View Geo-Localization

GLEAM: 在跨视图地理定位中学习匹配与解释

Xudong Lu, Zhi Zheng, Yi Wan, Yongxiang Yao, Annan Wang, Renrui Zhang, Panwang Xia, Qiong Wu, Qingyun Li, Weifeng Lin, Xiangyu Zhao, Peifeng Ma, Xue Yang, Hongsheng Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 GLEAM提出了一种结合多模态、多视角对齐与可解释对应分析的CVGL方法,通过双阶段训练策略提升精度并增强可解释性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00376 2026-02-03 cs.LG 57%

MATRIX: A Multimodal Benchmark and Post-Training Framework for Materials Science

MATRIX: 一种用于材料科学的多模态基准和后训练框架

Delia McGrath, Curtis Chong, Rohil Kulkarni, Gerbrand Ceder, Adeesh Kolluru

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 MATRIX通过多模态后训练提升材料科学推理,展示视觉引导对实验解释和文本任务的显著改进。

Comments 17 pages, 9 Figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00340 2026-02-03 cs.CV cs.AI 57%

Bridging the Semantic Chasm: Synergistic Conceptual Anchoring for Generalized Few-Shot and Zero-Shot OOD Perception

弥合语义鸿沟:协同概念锚定用于通用少样本和零样本OOD感知

Alexandros Christoforos, Sarah Jenkins, Michael Brown, Tuan Pham, David Chen

机构 * Boston University(波士顿大学) Suffolk University(苏富比大学) Kyung Hee University, South Korea(韩国庆熙大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 SynerNet通过协同神经代理网络框架,解决视觉语言模型在分布外概念感知中的跨模态对齐退化问题,提升少样本和零样本场景下的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00292 2026-02-03 cs.CV cs.AI 57%

LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification

LogicGaze:通过反事实验证基准测试视觉叙事中的因果一致性

Rory Driscoll, Alexandros Christoforos, Chadbourne Davis

机构 * Boston University(波士顿大学) Suffolk University(索尔福德大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 LogicGaze通过反事实验证基准测试,评估视觉语言模型在视觉叙事中因果一致性验证的能力,揭示了现有模型在处理因果链和幻觉问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00219 2026-02-03 cs.CR cs.AI 57%

Tri-LLM Cooperative Federated Zero-Shot Intrusion Detection with Semantic Disagreement and Trust-Aware Aggregation

三LLM协作联邦零日入侵检测:基于语义分歧与信任感知的聚合

Saeid Jamshidi, Omar Abdul Wahab, Foutse Khomh, Kawser Wazed Nafi

机构 * SWAT Laboratory, Polytechnique Montréal(Polytechnique Montréal SWAT 实验室) Department of Computer and Software Engineering, Polytechnique Montréal(Polytechnique Montréal 计算机与软件工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于三LLM的联邦IDS框架,通过语义监督实现零日入侵检测,提升对未知攻击行为的识别能力,同时增强对异构和不可靠客户端的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00082 2026-02-03 q-fin.ST cs.AI q-fin.TR 57%

Design and Empirical Study of a Large Language Model-Based Multi-Agent Investment System for Chinese Public REITs

基于大语言模型的多智能体投资系统设计与实证研究:中国公共REITs市场

Zheng Li

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究设计并实证了一种基于大语言模型的多智能体投资系统,用于中国公共REITs市场,通过多智能体协作提升交易的风险调整收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06979 2026-02-03 cs.CL 57%

MedTutor: A Retrieval-Augmented LLM System for Case-Based Medical Education

MedTutor: 一种基于检索的LLM系统用于基于病例的医学教育

Dongsuk Jang, Ziyao Shangguan, Kyle Tegtmeyer, Anurag Gupta, Jan Czerminski, Sophie Chheang, Arman Cohan

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) Department of Radiology and Biomedical Imaging, Yale School of Medicine(耶鲁医学院放射学与生物医学成像系) Interdisciplinary Program for Bioengineering, Seoul National University(首尔国立大学生物工程跨学科项目)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 MedTutor是一种基于检索的LLM系统,通过自动从临床病例报告生成教育内容和多项选择题,提升医学教育质量。

Comments Accepted to EMNLP 2025 (System Demonstrations)

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, pages 319-353

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01623 2026-02-03 cs.CV 50%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 安全评测 :alignment(abstract)

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07967 2026-02-03 cs.SE 50%

Code Digital Twin: A Knowledge Infrastructure for AI-Assisted Complex Software Development

代码数字孪生:面向AI辅助复杂软件开发的知识基础设施

Xin Peng, Chong Wang

专题命中 安全评测 :trustworthy(abstract)

AI总结 代码数字孪生通过整合混合知识表示和多阶段提取管道,为AI辅助复杂软件开发提供可持续的演进路径。

Comments A vision paper that will be continuously updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00840 2026-02-03 cs.SE 50%

Code Quality Analysis of Translations from C to Rust

从C到Rust的代码质量分析

Biruk Tadesse, Vikram Nitin, Mazin Salah, Baishakhi Ray, Marcelo d'Amorim, Wesley Assunção

专题命中 安全评测 :safety(abstract)

AI总结 本文研究了三种C到Rust翻译器的代码质量,发现尽管新技术减少了部分问题,但引入了新的问题,揭示了翻译质量的多维挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00757 2026-02-03 cs.SE 50%

ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming

ScratchEval:一种用于块式编程中LLM的多模态评估框架

Yuan Si, Simeng Han, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22642 2026-02-03 math.OC 50%

Machine Learning for Scheduling: A Paradigm Shift from Solver-Centric to Data-Centric Approaches

用于调度的机器学习:从以求解器为中心到以数据为中心的方法范式转变

Anbang Liu, Shaochong Lin, Jingchuan Chen, Peng Wu, Zuojun Max Shen

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文探讨了从求解器为中心到数据为中心的调度方法转变,分析了机器学习在提升计算效率和动态决策中的作用,并提出了适应性、智能和可信的调度系统的发展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02524 2026-02-03 cs.RO 50%

Versatile Behavior Diffusion for Generalized Traffic Agent Simulation

多功能行为扩散用于通用交通代理模拟

Zhiyu Huang, Zixu Zhang, Ameya Vaidya, Yuxiao Chen, Chen Lv, Jaime Fernández Fisac

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) NVIDIA Research(NVIDIA研究)

专题命中 安全评测 :safety(abstract)

AI总结 多功能行为扩散通过生成多代理互动场景,提升交通模拟的灵活性和实用性,为自动驾驶系统测试提供基础工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 6 篇

2602.01942 2026-02-03 cs.CR cs.AI 70%

Human Society-Inspired Approaches to Agentic AI Security: The 4C Framework

面向代理AI安全的人类社会启发方法:4C框架

Alsharif Abuadbba, Nazatul Sultan, Surya Nepal, Sanjay Jha

机构 * University of New South Wales, Sydney(新南威尔士大学悉尼分校)

专题命中 AI治理与伦理 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出4C框架,通过人类社会治理理念,为代理AI安全提供多维度保护,强调行为完整性和意图,构建可信可控的AI系统。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00751 2026-02-03 cs.AI cs.SE 70%

Engineering AI Agents for Clinical Workflows: A Case Study in Architecture,MLOps, and Governance

为临床工作流程工程AI代理:架构、MLOps和治理的案例研究

Cláudio Lúcio do Val Lopes, João Marcus Pitta, Fabiano Belém, Gildson Alves, Flávio Vinícius Cruzeiro Martins

机构 * A3Data CEFET-MG

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过整合四个工程支柱构建可信临床AI系统,展示Maria平台在架构、MLOps和治理方面的创新实践。

Comments 9 pages, 5 figures 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI}{April 12--13, 2026}{Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08855 2026-02-03 cs.CL cs.AI cs.LG 67%

BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Elicitation

BiasGym: 一个简单且通用的框架,用于通过诱发分析和去除偏见

Sekh Mainul Islam, Nadav Borenstein, Siddhesh Milind Pawar, Haeun Yu, Arnav Arora, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BiasGym通过安全注入和分析偏见,提供了一种简单且通用的方法来减少大语言模型中的偏见和刻板印象。

Comments Under review. Title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02170 2026-02-03 cs.MA cs.AI 57%

Self-Evolving Coordination Protocol in Multi-Agent AI Systems: An Exploratory Systems Feasibility Study

多智能体AI系统中的自演化协调协议:一种探索性系统可行性研究

Jose Manuel de la Chica Rodriguez, Juan Manuel Vera Díaz

机构 * AI Lab, Grupo Santander Madrid, Spain(西班牙桑坦德集团AI实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本研究探讨了自演化协调协议在多智能体系统中的可行性,通过实验展示有限自我修改在满足形式约束下的技术实现可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00816 2026-02-03 stat.ML cs.LG 57%

Hessian Spectral Analysis at Foundation Model Scale

基础模型规模下的Hessian谱分析

Diego Granziol, Khurshid Juarev

机构 * Mathematical Institute, University of Oxford, UK(牛津大学数学研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本研究在大规模基础模型上实现了Hessian谱的准确分析,揭示了块对角曲率近似在中等规模LLM中的失效问题,展示了谱探测的计算效率与实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00300 2026-02-03 cs.CL 57%

Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models

Faithful-Patchscopes: 理解和缓解大语言模型隐藏表示解释中的模型偏差

Xilin Gong, Shu Yang, Zehua Cao, Lynne Billard, Di Wang

机构 * University of Georgia(佐治亚大学) King Abdullah University of Science(国王阿卜杜勒-阿齐兹大学) Hong Kong Center for Construction Robotics(香港建筑机器人中心)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出BALOR方法,通过logit校准缓解大语言模型隐藏表示解释中的模型偏差,提升解释的忠实度和上下文信息的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 39 篇

2602.00038 2026-02-03 cs.CY cs.AI 88%

LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion

LSSF: 通过低秩安全子空间融合实现大语言模型的安全对齐

Guanghao Zhou, Panjia Qiu, Cen Chen, Hongyu Li, Mingyuan Chu, Xin Zhang, Jun Zhou

机构 * East China Normal University(华东师范大学) Ant Group(蚂蚁集团)

专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 LSSF通过低秩安全子空间融合技术,有效恢复微调大语言模型的安全对齐,同时对性能影响较小。

Comments Accepted in ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11085 2026-02-03 cs.LG cs.AI 81%

On the Importance of Pretraining Data Alignment for Atomic Property Prediction

关于预训练数据对齐在原子性质预测中的重要性

Yasir Ghunaim, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒-阿齐兹大学科学与技术学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文发现,通过精心选择的任务对齐数据集预训练,可提升原子性质预测的性能,且比大规模混合数据集预训练更有效。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01603 2026-02-03 stat.ML cs.LG 79%

Inference-Aware Meta-Alignment of LLMs via Non-Linear GRPO

通过非线性GRPO实现LLM的推理感知元对齐

Shokichi Takakura, Akifumi Wachi, Rei Higuchi, Kohei Miyaguchi, Taiji Suzuki

机构 * LY Corporation(LY公司) The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出IAMA方法,通过非线性GRPO实现LLM在有限计算资源下的多标准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00951 2026-02-03 cs.AI 79%

R-HTN: Rebellious Online HTN Planning for Safety and Game AI

R-HTN:安全与游戏AI中的反叛在线HTN规划

Hector Munoz-Avila, David W. Aha, Paola Rizzo

机构 * Computer Science \& Engineering, Lehigh University Bethlehem, PA 18015-3084 USA Navy Center for Applied Research in AI Naval Research Laboratory

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 R-HTN是一种用于安全与游戏AI的在线HTN规划算法,通过反叛机制在遵循指令的情况下实现任务目标。

Journal ref The Annual Conference on Advances in Cognitive Systems (ACS-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01547 2026-02-03 cs.SD eess.AS 78%

Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition

基于注意力加权中心核对齐的知识蒸馏:用于大音频-语言模型的语音情感识别

Qingran Yang, Botao Zhao, Zuheng Kang, Xue Li, Yayun He, Chuhang Liu, Xulong Zhang, Xiaoyang Qu, Junqing Peng, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 PL-Distill通过结合投影层和输出层蒸馏方法,有效压缩大音频-语言模型并提升语音情感识别性能。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00531 2026-02-03 cs.CV 78%

Enhancing Open-Vocabulary Object Detection through Multi-Level Fine-Grained Visual-Language Alignment

通过多级细粒度视觉-语言对齐增强开放词汇物体检测

Tianyi Zhang, Antoine Simoulin, Kai Li, Sana Lakdawala, Shiqing Yu, Arpit Mittal, Hongyu Fu, Yu Lin

机构 * University of Minnesota(明尼苏达大学) Meta

专题命中 其他安全 :alignment(title,abstract)

AI总结 VLDet通过多级细粒度视觉-语言对齐提升开放词汇物体检测性能,引入VL-PUB模块和SigRPN块,实现新类别检测的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01689 2026-02-03 cs.AI cs.LG 73%

What LLMs Think When You Don't Tell Them What to Think About?

当你不告诉LLMs该思考什么时,它们会想什么?

Yongchan Kwon, James Zou

机构 * Together AI Stanford University(斯坦福大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了LLMs在无明确主题输入下生成内容的分布特征,发现不同模型家族存在显著的主题偏好和内容深度差异,并公开了相关数据集和代码。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01268 2026-02-03 cs.CV cs.RO 71%

OASIS-DC: Generalizable Depth Completion via Output-level Alignment of Sparse-Integrated Monocular Pseudo Depth

OASIS-DC: 通过稀疏集成单目伪深度的输出级对齐实现通用深度补全

Jaehyeon Cho, Jhonghyun An

机构 * Vehicle Intelligence Perception Lab (VIPLAB), Gachon University, Seongnam-si, Republic of Korea(高银大学)

专题命中 其他安全 :alignment(title)

AI总结 OASIS-DC通过输出级对齐稀疏集成单目伪深度,实现无需大量标注样本的通用深度补全。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01618 2026-02-03 cs.CL 70%

SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia

SEA-Guard:面向东南亚的文化根基多语言安全防护

Panuthep Tasawong, Jian Gang Ngui, Alham Fikri Aji, Trevor Cohn, Peerat Limkonchotiwat

机构 * VISTEC Google(谷歌) AI Singapore(AI新加坡)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 SEA-Guard是首个基于东南亚文化背景的多语言安全模型,通过代理数据生成框架构建区域特定安全数据集,有效检测地区敏感内容并保持良好的通用安全性能。

Comments Under reivew

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11367 2026-02-03 cs.LG cs.AI cs.CL 67%

Sparse Autoencoder Features for Classifications and Transferability

稀疏自编码器特征用于分类和可迁移性

Jack Gallifant, Shan Chen, Kuleen Sasse, Hugo Aerts, Thomas Hartvigsen, Danielle S. Bitterman

机构 * Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) Johns Hopkins University(约翰霍普金斯大学) Maastricht University(马斯特里赫特大学) University of Virginia(弗吉尼亚大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用稀疏自编码器提取LLM特征,通过优化架构和二进制化策略提升分类性能和跨模型迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14151 2026-02-03 cs.LG cs.AI cs.CY cs.DB 67%

Trajectory Data Management and Mining: A Survey from Deep Learning to the LLM Era

轨迹数据管理与挖掘:从深度学习到大语言模型时代的综述

Wei Chen, Yuanshao Zhu, Yanchuan Chang, Kang Luo, Haomin Wen, Lei Li, Yanwei Yu, Qingsong Wen, Chao Chen, Kai Zheng, Yunjun Gao, Yu Zheng, Xiaofang Zhou, Yuxuan Liang

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文综述了轨迹计算从深度学习到大语言模型的发展,探讨了轨迹数据管理与挖掘的应用及未来研究方向。

Comments Version 2 of Trajectory Survey

详情

展开后加载摘要…

URL PDF HTML 收藏