arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-07 至 2026-01-07 共收录 41 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2601.02398 2026-01-07 cs.NI cs.AI 57%

AI-Native Integrated Sensing and Communications for Self-Organizing Wireless Networks: Architectures, Learning Paradigms, and System-Level Design

面向自组织无线网络的AI原生集成感知与通信:架构、学习范式与系统级设计

S. Zhang, M. Feizarefi, A. F. Mirzaei

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了AI原生集成感知与通信在自组织无线网络中的架构、学习范式及系统设计,探讨了深度强化学习等方法在动态环境中的应用及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01116 2026-01-07 stat.ME q-bio.QM 50%

Beyond P-Values: Importing Quantitative Finance's Risk and Regret Metrics for AI in Learning Health Systems

超越P值:将定量金融的风险和遗憾度量引入AI在学习健康系统中的应用

Richik Chakraborty

专题命中 安全评测 :safety(abstract)

AI总结 本文提出将定量金融的风险和遗憾度量引入AI在学习健康系统中的应用,以改进对持续学习系统中证据和安全性的评估。

Comments Manuscript: 12 pages, 3 mathematical boxes, 1 figure, 1 table, 26 references

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2601.02858 2026-01-07 cs.CL 74%

To Generate or Discriminate? Methodological Considerations for Measuring Cultural Alignment in LLMs

是生成还是判别?衡量LLM文化契合度的方法论考虑

Saurabh Kumar Pandey, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL

AI总结 本文通过反向社会人口提示方法探讨LLM文化契合度测量问题,发现真实行为表现优于模拟行为,但个体层面个性化存在局限。

Comments IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02749 2026-01-07 cs.AI 70%

The Path Ahead for Agentic AI: Challenges and Opportunities

代理AI的未来之路:挑战与机遇

Nadia Sibai, Yara Ahmed, Serry Sibaee, Sawsan AlHalawani, Adel Ammar, Wadii Boulila

机构 * Robotics and Internet-of-Things (RIOTU) Lab, Prince Sultan University, Riyadh, Saudi Arabia(机器人与物联网(RIOTU)实验室,普森大学,利雅得,沙特阿拉伯)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文探讨了代理AI从被动生成到自主行动的转变,分析了其技术挑战与核心方法,并提出了实现自主行为的关键研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03203 2026-01-07 cs.LG cs.AI cs.CY 67%

Counterfactual Fairness with Graph Uncertainty

基于图不确定性的反事实公平性

Davi Valério, Chrysoula Zerva, Mariana Pinto, Ricardo Santos, André Carreiro

机构 * Instituto Superior Técnico(里斯本技术高等学院) Instituto de Telecomunicações(电信研究所) Fraunhofer Portugal AICOS(弗劳恩霍夫葡萄牙AICOS研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出CF-GU方法,通过整合因果图的不确定性,提升反事实公平性评估的鲁棒性和准确性。

Comments Peer reviewed pre-print. Presented at the BIAS 2025 Workshop at ECML PKDD

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 6 篇

2601.03047 2026-01-07 cs.LG 70%

When the Coffee Feature Activates on Coffins: An Analysis of Feature Extraction and Steering for Mechanistic Interpretability

当咖啡特征在棺材上激活:对特征提取和转向用于机制可解释性的分析

Raphael Ronge, Markus Maier, Frederick Eberhardt

机构 * Department of Philosophy of Nature and Technology(自然哲学与技术系) Munich School of Philosophy(慕尼黑哲学学院) Division of the Humanities and Social Sciences(人文与社会科学系) California Institute of Technology(加州理工学院)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文分析了通过稀疏自编码器提取特征和控制模型输出的方法,指出其在机制可解释性中的局限性和可靠性问题,强调需转向更可靠的预测与控制。

Comments 33 pages (65 with appendix), 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01584 2026-01-07 cs.CL 57%

Steerability of Instrumental-Convergence Tendencies in LLMs

在大语言模型中操控工具收敛倾向的可行性

Jakub Hoscilowicz

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 该研究通过反工具提示显著降低大语言模型的收敛率,揭示了可控性与安全之间的矛盾,为AI系统的设计提供了新的安全策略。

Comments Code is available at https://github.com/j-hoscilowicz/instrumental_steering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03233 2026-01-07 cs.CV 50%

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2:高效的音频-视觉联合基础模型

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

机构 * Lightricks(利光科技)

专题命中 其他安全 :alignment(abstract)

AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02852 2026-01-07 physics.flu-dyn 50%

ML enhanced measurement of the electrostatic charge distribution of powder conveyed through a duct

基于机器学习的粉末在管道中电荷分布测量

Christoph Wilms, Wenchao Xu, Gizem Ozler, Simon Jantač, Sonja Schmelter, Holger Grosshans

专题命中 其他安全 :safety(abstract)

AI总结 本文提出利用浅层神经网络,通过一维测量数据估计管道中粉体的二维电荷分布,以提高过程安全性。

Journal ref Journal of Loss Prevention in the Process Industries, 92, 105474 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02779 2026-01-07 eess.SY cs.SY 50%

Hierarchical Preemptive Holistic Collaborative Systems for Embodied Multi-Agent Systems: Framework, Hybrid Stability, and Scalability Analysis

分层抢先整体协作系统用于具身多智能体系统:框架、混合稳定性与可扩展性分析

Ting Peng

专题命中 其他安全 :safety(abstract)

AI总结 本文提出分层抢先整体协作框架,通过分解全局协调问题提升具身多智能体系统的安全性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11160 2026-01-07 eess.AS cs.SD 50%

S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation

S2ST-Omni: 多语言语音到语音翻译的分层语言感知语音LLM适应

Yu Pan, Xiongfei Wu, Yuguang Yang, Jixun Yao, Lei Ma, Jianjun Zhao

机构 * Tencent(腾讯) ByteDance Ltd.(字节跳动)

专题命中 其他安全 :alignment(abstract)

AI总结 S2ST-Omni通过分层语言感知架构和模块化TTS后端,实现多语言语音到语音翻译的高准确性和灵活性。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏