arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-13 至 2026-01-13 共收录 98 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 32 篇

2505.08728 2026-01-13 cs.CR cs.AI cs.IR 57%

Securing RAG: A Risk Assessment and Mitigation Framework

保障RAG:风险评估与缓解框架

Lukas Ammann, Sara Ott, Christoph R. Landolt, Marco P. Lehmann

机构 * Eastern Switzerland University of Applied Sciences (OST)(东瑞士应用科学大学(OST)) Cyber-Defence Campus, armasuisse Science and Technology(网络安全校园,armasuisse科技)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种结合RAG特定安全考虑与通用安全指南的框架,以保障RAG系统的安全性和可信度。

Comments 8 pages, 3 figures, Sara Ott and Lukas Ammann contributed equally. This work has been submitted to the IEEE for possible publication

Journal ref 2025 IEEE Swiss Conference on Data Science (SDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06845 2026-01-13 cs.AI 57%

Code Evolution for Control: Synthesizing Policies via LLM-Driven Evolutionary Search

代码进化用于控制:通过LLM驱动的进化搜索合成策略

Ping Guo, Chao Li, Yinglan Feng, Chaoning Zhang

机构 * Shenzhen Yuyi Tech. Co. Ltd.(深圳优衣科技有限公司) City University of Hong Kong(香港城市大学) Shenzhen University(深圳大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出利用LLM驱动的进化搜索生成可解释的控制策略,通过代码进化方法合成可执行代码,提升自主系统控制策略的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06516 2026-01-13 cs.HC cs.LG eess.SP 57%

Pareto-Optimal Model Selection for Low-Cost, Single-Lead EMG Control in Embedded Systems

低成本单通道EMG控制的帕累托最优模型选择

Carl Vincent Ladres Kho

机构 * Minerva University(明维大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种低成本单通道EMG控制的帕累托最优模型选择方法,通过评估多种模型架构,确定随机森林在嵌入式控制中的最优性能。

Comments 15 pages main text, 51 pages total including appendices. 18 figures. Code and dataset available at: https://github.com/CarlKho-Minerva/v2-emg-muscle

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06141 2026-01-13 cs.CY 57%

An LLM -Powered Assessment Retrieval-Augmented Generation (RAG) For Higher Education

基于大语言模型的评估检索增强生成(RAG)系统用于高等教育

Reza Vatankhah Barenji, Nazila Salimi, Sina Khoshgoftar

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 本研究提出基于RAG架构的大语言模型驱动评估系统,通过整合评分标准和范文生成高质量反馈,实现大规模、一致的评估反馈,提升学生自主学习能力。

Comments 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05774 2026-01-13 cs.AI 57%

ConstraintLLM: A Neuro-Symbolic Framework for Industrial-Level Constraint Programming

ConstraintLLM: 一种用于工业级约束编程的神经符号框架

Weichun Shi, Minghao Liu, Wanting Zhang, Langchen Shi, Fuqi Jia, Feifei Ma, Jian Zhang

机构 * Hangzhou Institute for Advanced Study, UCAS, Hangzhou, China(杭州高等研究院,UCAS,杭州,中国) University of Oxford, Oxford, UK(牛津大学,牛津,英国) University of Science and Technology Beijing, Beijing, China(北京科技大学,北京,中国) SKLCS and Key Laboratory of System Software, ISCAS, Beijing, China(SKLCS和系统软件重点实验室,ISCAS,北京,中国) Laboratory of Parallel Software and Computational Science, ISCAS, Beijing, China(并行软件与计算科学实验室,ISCAS,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 ConstraintLLM是一种专为约束编程设计的神经符号框架,通过引入Constraint-Aware Retrieval Module和Tree-of-Thoughts框架,实现了在工业级约束编程基准上的高性能求解。

Comments Accepted to the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), Main Conference

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 15999-16019

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11890 2026-01-13 cs.RO cs.AI 57%

Integrating Symbolic RL Planning into a BDI-based Autonomous UAV Framework: System Integration and SIL Validation

将符号RL规划整合到基于BDI的自主无人机框架中:系统集成与SIL验证

Sangwoo Jeon, Juchul Shin, YeonJe Cho, Gyeong-Tae Kim, Seongwoo Kim

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出AMAD-SRL框架,整合符号RL与BDI方法,通过SIL验证提升无人机任务效率75%。

Comments This submission has been withdrawn by the authors due to institutional and contractual requirements related to security and export-control review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07186 2026-01-13 cs.RO 50%

PROTEA: Securing Robot Task Planning and Execution

PROTEA:保障机器人任务规划与执行的安全性

Zainab Altaweel, Mohaiminul Al Nahian, Jake Juettner, Adnan Siraj Rakin, Shiqi Zhang

专题命中 安全评测 :safety(abstract)

AI总结 PROTEA通过LLM-as-a-Judge机制评估机器人任务计划的安全性,解决维度和历史挑战,提升任务规划系统的鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06779 2026-01-13 cs.CR 50%

CyberLLM-FINDS 2025: Instruction-Tuned Fine-tuning of Domain-Specific LLMs with Retrieval-Augmented Generation and Graph Integration for MITRE Evaluation

CyberLLM-FINDS 2025:基于检索增强生成和图集成的领域特定LLM指令微调方法用于MITRE评估

Vasanth Iyer, Leonardo Bobadilla, S. S. Iyengar

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出了一种基于检索增强生成和图集成的领域特定LLM微调方法,通过STIX威胁情报实现与MITRE ATT&CK技术的对齐,提升网络安全威胁情报分析的准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06728 2026-01-13 cs.RO 50%

Robust Evacuation for Multi-Drone Failure in Drone Light Shows

多无人机故障下的鲁棒疏散

Minhyuk Park, Aloysius K. Mok, Tsz-Chiu Au

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出了一种针对多无人机故障的鲁棒疏散算法,通过预测故障无人机轨迹并利用隐藏无人机实现快速恢复,提高无人机灯光秀的可靠性。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06616 2026-01-13 cs.HC 50%

LLM-Driven Accessible Interface: A Model-Based Approach

基于大语言模型的可及性界面:一种基于模型的方法

Blessing Jerry, Lourdes Moreno, Virginia Francisco, Raquel Hervas

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种基于模型的框架,利用大语言模型生成个性化、多模态且符合可及性标准的用户界面,通过结构化用户档案、声明性适应规则和验证提示模板,提升医疗场景中对认知和感官需求的可及性支持。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 8 篇

2601.06153 2026-01-13 cs.CY cs.AI 90%

Interoperability in AI Safety Governance: Ethics, Regulations, and Standards

人工智能安全治理中的互操作性:伦理、法规与标准

Yik Chan Chin, David A. Raho, Hag-Min Kim, Chunli Bi, James Ong, Jingbo Huang, Serge Stinckwich

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本报告通过比较四个国家在自动驾驶、教育和跨境数据流动领域的伦理、法律和技术框架,提出促进人工智能安全治理互操作性的政策建议。

Comments 122 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06047 2026-01-13 cs.AI cs.CL cs.CY 75%

"They parted illusions -- they parted disclaim marinade": Misalignment as structural fidelity in LLMs

他们分开了幻象——他们分开了否定腌制:在大语言模型中将不一致视为结构忠实

Mariana Lins Costa

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出大语言模型中'不一致'现象源于对不一致语言结构的忠实,而非欺骗性意图,通过分析案例和实证数据,揭示语言结构与意图生成的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07806 2026-01-13 cs.CL cs.LG 62%

The Confidence Trap: Gender Bias and Predictive Certainty in LLMs

自信陷阱:大语言模型中的性别偏见与预测确定性

Ahmed Sabir, Markus Kängsepp, Rajesh Sharma

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨大语言模型在性别偏见任务中的置信度校准问题,提出Gender-ECE指标以评估公平性差异,发现Gemma-2在性别偏见基准中校准最差。

Comments AAAI 2026 (AISI Track), Oral. Project page: https://bit.ly/4p8OKQD

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06223 2026-01-13 cs.CY cs.AI 62%

Toward Safe and Responsible AI Agents: A Three-Pillar Model for Transparency, Accountability, and Trustworthiness

迈向安全和负责任的AI代理:透明、问责和可信的三支柱模型

Edward C. Cheng, Jeshua Cheng, Alice Siu

机构 * InquiryOn

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出三支柱模型,旨在通过透明、问责和可信机制,确保AI代理的安全性和责任性,促进负责任的AI发展。

Comments 15 pages, 8 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06101 2026-01-13 cs.CY cs.AI 62%

How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures

如何评估人工智能素养:自我报告与基于客观的评估之间的不一致

Shan Zhang, Ruiwei Xiao, Anthony F. Botelho, Guanze Liao, Thomas K. F. Chiu, John Stamper, Kenneth R. Koedinger

机构 * University of Florida(佛罗里达大学) Carnegie Mellon University(卡内基梅隆大学) National Tsing Hua University(国立清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究开发并评估了教师人工智能素养的自我报告和基于客观的测量方法,揭示了两者在不同教师群体中的显著差异,并提出了适用于专业发展的诊断工具。

Comments 16 pages, 6 figures, LAK2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06064 2026-01-13 cs.CY cs.AI cs.MA 62%

Socio-technical aspects of Agentic AI

群体技术视角下的代理AI

Praveen Kumar Donta, Alaa Saleh, Ying Li, Shubham Vaishnav, Kai Fang, Hailin Feng, Yuchao Xia, Thippa Reddy Gadekallu, Qiyang Zhang, Xiaodan Shi, Ali Beikmohammadi, Sindri Magnússon, Ilir Murturi, Chinmaya Kumar Dehury, Marcin Paprzycki, Lauri Loven, Sasu Tarkoma, Schahram Dustdar

机构 * Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系) Center for Ubiquitous Computing, University of Oulu(奥卢大学无处不在计算中心) College of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Zhejiang A\&F University, Hangzhou(浙江工业大学之江学院) School of Computer Science, Peking University(北京大学计算机科学学院) Department of Mechatronics, University of Prishtina(普里什蒂纳大学机电系) Department of Computer Science, IISER Berhampur(伯尔哈普尔IISER计算机科学系) Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) Department of Computer Science, University of Helsinki(赫尔辛基大学计算机科学系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文从社会技术视角探讨代理AI,分析其技术组件与社会背景的关联,揭示伦理挑战及未来研究方向。

Comments Dear Reviewer, please note that this is not survey/review or position paper. This paper introduced new framework (MAD-BAD-SAD Framework) for Socio-technical aspects of Agentic AI, Ethical considerations, which is very important to consider beside technical development

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06040 2026-01-13 cs.CY 57%

Cognitive Sovereignty and the Neurosecurity Governance Gap: Evidence from Singapore

认知主权与神经安全治理鸿沟:来自新加坡的证据

Hailee Carter

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨了认知主权与神经安全治理鸿沟,通过新加坡案例分析,提出认知主权框架以保护神经过程免受外部干扰。

Comments 18 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07051 2026-01-13 cs.SE 50%

Between Policy and Practice: GenAI Adoption in Agile Software Development Teams

在政策与实践之间:生成式AI在敏捷软件开发团队中的采用

Michael Neumann, Lasse Bischof, Nic Elias Hinz, Luca Stockmann, Dennis Schrader, Ana Carolina Ahaus, Erim Can Demirci, Benjamin Gabel, Maria Rauschenberger, Philipp Diebold, Henning Fritzemeier, Adam Przybylek

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究探讨了生成式AI在敏捷软件开发团队中的实际采用情况,发现其主要用于创意任务和文档协助,但面临数据隐私和治理等障碍,需通过TOE框架协调政策与实践以实现有效整合。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 20 篇

2601.06197 2026-01-13 cs.AI cs.CR 88%

AI Safeguards, Generative AI and the Pandora Box: AI Safety Measures to Protect Businesses and Personal Reputation

AI安全措施、生成式AI与潘多拉魔盒:保护企业和个人声誉的AI安全方法

Prasanna Kumar

专题命中 其他安全 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文提出利用时间一致性学习技术,通过预训练时间卷积网络模型,高效检测生成式AI的黑暗面问题,以提升AI安全性并保护企业和个人声誉。

Comments 10 pages, 3 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 82%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06335 2026-01-13 cs.SE cs.AI 79%

Foundational Analysis of Safety Engineering Requirements (SAFER)

安全工程需求基础分析(SAFER)

Noga Chemo, Yaniv Mordecai, Yoram Reich

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 SAFER通过生成式人工智能和模型驱动方法,提升复杂安全关键系统的需求生成与分析,解决需求冲突和不一致问题,提高安全工程效率和可靠性。

Journal ref IEEE Aerospace Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07682 2026-01-13 physics.ins-det 78%

Sub-Pixel Electron Beam Alignment for Machine Learning Characterization of Hybrid Pixel Detectors

亚像素电子束对准用于机器学习对混合像素探测器的表征

Emiliya Poghosyan, Xiangyu Xie, Joakim Reuteler, Kirsty A. Paton, Luis Barba Flores, Benjamin Béjar Haro, Erik Fröjdh, Anna Bergamaschi, Elisabeth Müller

专题命中 其他安全 :alignment(title,abstract)

AI总结 本研究提出两种新方法生成高质量训练数据,用于通过机器学习实现混合像素探测器的亚像素对准和超分辨率表征。

Comments 11 pages, 6 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06123 2026-01-13 cs.LG cs.AI 76%

Latent Space Communication via K-V Cache Alignment

通过K-V缓存对齐实现潜在空间通信

Lucio M. Dery, Zohar Yahav, Henry Prior, Qixuan Feng, Jiajun Shen, Arthur Szlam

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出通过学习共享表示空间对齐多模型的k-v缓存,实现模型间高效协作与知识共享,提升整体性能与能力转移。

Comments 15 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06875 2026-01-13 cs.AI cs.CL 62%

An Ubuntu-Guided Large Language Model Framework for Cognitive Behavioral Mental Health Dialogue

以Ubuntu为指导的认知行为大型语言模型框架用于认知行为心理健康对话

Sontaga G. Forane, Absalom E. Ezugwu, Kevin Igwe, Karen van den Berg

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结合Ubuntu哲学与认知行为疗法的AI心理健康对话系统,旨在提升非洲语境下的文化敏感性和治疗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06061 2026-01-13 cs.CY cs.AI 62%

AI Application Operations -- A Socio-Technical Framework for Data-driven Organizations

AI应用操作——数据驱动组织的社会技术框架

Daniel Jönsson, Mattias Tiger, Stefan Ekberg, Daniel Jakobsson, Mattias Jonhede, Fredrik Viksten

机构 * Linköping University(林海普大学) AI Sweden(AI瑞典) Swedish Transport Administration(瑞典交通管理局) Volvo Group(沃尔沃集团)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种社会技术框架,用于指导数据驱动组织从想法到生产的AI应用操作,强调持续监控和反馈机制以实现持续改进和价值实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12704 2026-01-13 cs.CL cs.AI 62%

Flexible Realignment of Language Models

语言模型的灵活重校准

Wenhong Zhu, Ruobing Xie, Weinan Zhang, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出灵活的重校准框架,通过训练和推理时的可控对齐方法,提升语言模型的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06472 2026-01-13 cs.CL cs.AI cs.CE cs.DL 62%

KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment

KARMA:利用多智能体大语言模型实现知识图谱的自动化丰富

Yuxing Lu, Wei Wu, Xukai Zhao, Rui Peng, Jinzhuo Wang

机构 * Department of Big Data and Biomedical AI, Peking University(北京大学大数据与生物医学人工智能系) Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) School of Architecture, Tsinghua University(清华大学建筑学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过多智能体大语言模型自动丰富知识图谱,有效识别新实体并提高正确性与一致性

Comments 24 pages, 3 figures, 2 tables

Journal ref Spotlight paper of NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 57%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07033 2026-01-13 cs.CL 57%

Codified Foreshadowing-Payoff Text Generation

编码的预兆-回报文本生成

Longfei Yun, Kun Zhou, Yupeng Hou, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出CFPG框架,通过编码预兆-回报机制,提升LLM的叙事生成能力,实现情节逻辑的准确兑现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06527 2026-01-13 cs.LG stat.ML 57%

Wide Neural Networks as a Baseline for the Computational No-Coincidence Conjecture

宽神经网络作为计算无巧合猜想的基线

John Dunbar, Scott Aaronson

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出宽神经网络作为计算无巧合猜想的基线,通过证明具有零均值激活函数的神经网络输出几乎独立,以衡量AI可解释性的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏