arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-13 至 2026-01-13 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 20 篇

2601.06197 2026-01-13 cs.AI cs.CR 88%

AI Safeguards, Generative AI and the Pandora Box: AI Safety Measures to Protect Businesses and Personal Reputation

AI安全措施、生成式AI与潘多拉魔盒:保护企业和个人声誉的AI安全方法

Prasanna Kumar

专题命中 其他安全 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文提出利用时间一致性学习技术,通过预训练时间卷积网络模型,高效检测生成式AI的黑暗面问题,以提升AI安全性并保护企业和个人声誉。

Comments 10 pages, 3 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 82%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06335 2026-01-13 cs.SE cs.AI 79%

Foundational Analysis of Safety Engineering Requirements (SAFER)

安全工程需求基础分析(SAFER)

Noga Chemo, Yaniv Mordecai, Yoram Reich

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 SAFER通过生成式人工智能和模型驱动方法,提升复杂安全关键系统的需求生成与分析,解决需求冲突和不一致问题,提高安全工程效率和可靠性。

Journal ref IEEE Aerospace Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07682 2026-01-13 physics.ins-det 78%

Sub-Pixel Electron Beam Alignment for Machine Learning Characterization of Hybrid Pixel Detectors

亚像素电子束对准用于机器学习对混合像素探测器的表征

Emiliya Poghosyan, Xiangyu Xie, Joakim Reuteler, Kirsty A. Paton, Luis Barba Flores, Benjamin Béjar Haro, Erik Fröjdh, Anna Bergamaschi, Elisabeth Müller

专题命中 其他安全 :alignment(title,abstract)

AI总结 本研究提出两种新方法生成高质量训练数据,用于通过机器学习实现混合像素探测器的亚像素对准和超分辨率表征。

Comments 11 pages, 6 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06123 2026-01-13 cs.LG cs.AI 76%

Latent Space Communication via K-V Cache Alignment

通过K-V缓存对齐实现潜在空间通信

Lucio M. Dery, Zohar Yahav, Henry Prior, Qixuan Feng, Jiajun Shen, Arthur Szlam

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出通过学习共享表示空间对齐多模型的k-v缓存,实现模型间高效协作与知识共享,提升整体性能与能力转移。

Comments 15 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06875 2026-01-13 cs.AI cs.CL 62%

An Ubuntu-Guided Large Language Model Framework for Cognitive Behavioral Mental Health Dialogue

以Ubuntu为指导的认知行为大型语言模型框架用于认知行为心理健康对话

Sontaga G. Forane, Absalom E. Ezugwu, Kevin Igwe, Karen van den Berg

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结合Ubuntu哲学与认知行为疗法的AI心理健康对话系统,旨在提升非洲语境下的文化敏感性和治疗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06061 2026-01-13 cs.CY cs.AI 62%

AI Application Operations -- A Socio-Technical Framework for Data-driven Organizations

AI应用操作——数据驱动组织的社会技术框架

Daniel Jönsson, Mattias Tiger, Stefan Ekberg, Daniel Jakobsson, Mattias Jonhede, Fredrik Viksten

机构 * Linköping University(林海普大学) AI Sweden(AI瑞典) Swedish Transport Administration(瑞典交通管理局) Volvo Group(沃尔沃集团)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种社会技术框架,用于指导数据驱动组织从想法到生产的AI应用操作,强调持续监控和反馈机制以实现持续改进和价值实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12704 2026-01-13 cs.CL cs.AI 62%

Flexible Realignment of Language Models

语言模型的灵活重校准

Wenhong Zhu, Ruobing Xie, Weinan Zhang, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出灵活的重校准框架,通过训练和推理时的可控对齐方法,提升语言模型的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06472 2026-01-13 cs.CL cs.AI cs.CE cs.DL 62%

KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment

KARMA:利用多智能体大语言模型实现知识图谱的自动化丰富

Yuxing Lu, Wei Wu, Xukai Zhao, Rui Peng, Jinzhuo Wang

机构 * Department of Big Data and Biomedical AI, Peking University(北京大学大数据与生物医学人工智能系) Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) School of Architecture, Tsinghua University(清华大学建筑学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过多智能体大语言模型自动丰富知识图谱,有效识别新实体并提高正确性与一致性

Comments 24 pages, 3 figures, 2 tables

Journal ref Spotlight paper of NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 57%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07033 2026-01-13 cs.CL 57%

Codified Foreshadowing-Payoff Text Generation

编码的预兆-回报文本生成

Longfei Yun, Kun Zhou, Yupeng Hou, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出CFPG框架,通过编码预兆-回报机制,提升LLM的叙事生成能力,实现情节逻辑的准确兑现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06527 2026-01-13 cs.LG stat.ML 57%

Wide Neural Networks as a Baseline for the Computational No-Coincidence Conjecture

宽神经网络作为计算无巧合猜想的基线

John Dunbar, Scott Aaronson

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出宽神经网络作为计算无巧合猜想的基线,通过证明具有零均值激活函数的神经网络输出几乎独立,以衡量AI可解释性的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03544 2026-01-13 math.OC cs.AI cs.RO 57%

Agile Tradespace Exploration for Space Rendezvous Mission Design via Transformers

通过变换器实现空间交汇任务设计的敏捷贸易空间探索

Yuji Takubo, Daniele Gammelli, Marco Pavone, Simone D'Amico

机构 * Dept. of Aeronautics & Astronautics Stanford University(航空与航天系 斯坦福大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于变换器的框架,实现快速生成多目标交汇任务的帕累托最优轨迹,提升任务设计效率与灵活性。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00828 2026-01-13 cs.CR cs.AI 57%

Towards Ultra-Low Latency: Binarized Neural Network Architectures for In-Vehicle Network Intrusion Detection

迈向超低延迟:用于车载网络入侵检测的二值化神经网络架构

Huiyao Dong, Igor Kotenko

机构 * Faculty of Information Technology and Security(信息科技与安全学院) ITMO University(ITMO大学) Laboratory of Computer Security Problems(计算机安全问题实验室) St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS)(俄罗斯科学院圣彼得堡联邦科研中心(SPC RAS))

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于二值化神经网络的轻量级入侵检测方法,通过混合二进制编码技术提升车载网络安全性,适用于实时通信场景。

Comments 6 pages, accepted and presented at INISTA 2025 (https://conferences.sigappfr.org/inista2025/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04791 2026-01-13 cs.AI 57%

What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking

大型语言模型的What-If分析:通过前瞻性思维探索游戏世界

Yuan Sui, Yanming Zhang, Yi Liao, Yu Gu, Guohua Tang, Zhongqian Sun, Wei Yang, Bryan Hooi

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00140 2026-01-13 cs.SE cs.AI 57%

LLM-based Zero-shot Triple Extraction for Automated Ontology Generation from Software Engineering Standards

基于大型语言模型的零样本三元组提取用于从软件工程标准自动生成本体

Songhui Yue

机构 * Computer Science Department(计算机科学系) Charleston Southern University(查尔斯顿南方大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于LLM的零样本三元组提取方法,用于从软件工程标准中自动生成本体,通过改进的工作流程和专家标注集验证了其有效性。

Comments Semantic Data Integration Workshop, held in conjunction with IEEE International Conference on Semantic Computing (IEEE ICSC 2026), accepted, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07219 2026-01-13 cs.CV 50%

VENUS: Visual Editing with Noise Inversion Using Scene Graphs

VENUS: 使用场景图进行视觉编辑的噪声反演

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 其他安全 :alignment(abstract)

AI总结 VENUS是一种无需训练的场景图引导图像编辑框架,通过噪声反演和拆分提示策略提升图像编辑的保真度和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07181 2026-01-13 cs.CV 50%

ShowUI-Aloha: Human-Taught GUI Agent

ShowUI-Aloha: 由人类指导的GUI代理

Yichun Zhang, Xiangwu Guo, Yauhong Goh, Jessica Hu, Zhiheng Chen, Xin Wang, Difei Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 其他安全 :safety(abstract)

AI总结 ShowUI-Aloha通过将无结构的人类屏幕记录转化为结构化任务,提供了一种可扩展的解决方案,用于构建能够从观察人类中有效学习的通用GUI代理。

Comments 13 Pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07092 2026-01-13 cs.CV 50%

Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression

面向自动驾驶的高效视觉问答流水线:场景区域压缩

Yuliang Cai, Dongqiangzi Ye, Zitian Chen, Chongruo Wu

机构 * University of Southern California(南加州大学) XPeng(小鹏)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出SRC-Pipeline框架,通过场景区域压缩技术,在保持性能的同时显著降低计算成本,提升自动驾驶中的实时视觉问答效率。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06490 2026-01-13 cs.MA 50%

Bi-Mem: Bidirectional Construction of Hierarchical Memory for Personalized LLMs via Inductive-Reflective Agents

Bi-Mem: 通过归纳-反思代理双向构建层次化记忆以实现个性化大语言模型

Wenyu Mao, Haosong Tan, Shuchang Liu, Haoyang Liu, Yifan Xu, Huaxiang Ji, Xiang Wang

专题命中 其他安全 :alignment(abstract)

AI总结 Bi-Mem通过归纳-反思代理双向构建层次化记忆,解决对话噪声和记忆幻觉问题,提升个性化大语言模型的问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏