arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-05 至 2026-02-05 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 11 篇

2602.03849 2026-02-05 cs.HC cs.AI cs.CL cs.LG 67%

HybridQuestion: Human-AI Collaboration for Identifying High-Impact Research Questions

HybridQuestion: 人机协作识别高影响力研究问题

Keyu Zhao, Fengli Xu, Yong Li, Tie-Yan Liu

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、北京理工大学、清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HybridQuestion通过人机协作识别高影响力研究问题,利用AI处理数据与人类判断结合,验证了在科学突破和未来问题预测中的有效性。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21436 2026-02-05 cs.LG cs.AI cs.CL cs.CV 67%

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

从一致性到互补性:面向时间序列理解和推理的对齐与解缠多模态学习

Hang Ni, Weijia Zhang, Fei Wang, Zezhi Shao, Hao Liu

机构 * The Hong Kong University of Science(香港科学与技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MADI通过细粒度对齐和解缠交互提升多模态时间序列理解和推理能力,实现更精确的数值-视觉模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04116 2026-02-05 cs.LG cs.AI cs.SI 62%

Toward Effective Multimodal Graph Foundation Model: A Divide-and-Conquer Based Approach

迈向有效的多模态图基础模型:基于分而治之的方法

Sicheng Liu, Xunkai Li, Daohan Su, Ru Zhang, Hongchao Qin, Ronghua Li, Guoren Wang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 PLANET提出了一种基于分而治之的方法,通过解耦模态交互和对齐,提升多模态图基础模型的性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04074 2026-02-05 cs.LG cs.CL 62%

Stroke Lesions as a Rosetta Stone for Language Model Interpretability

中风病变作为语言模型可解释性的一种罗塞塔石碑

Julius Fridriksson, Roger D. Newman-Norlund, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Xiang Guan, Yong Yang, Srihari Nelakuditi, Rutvik Desai, Leonardo Bonilha, Jeff Charney, Chris Rorden

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 中风病变被用于验证语言模型的可解释性,通过比较模型扰动与人类病变模式,揭示语言处理的共享计算原则。

Comments 45 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14157 2026-02-05 cs.SD cs.AI cs.LG 62%

ConceptCaps: a Distilled Concept Dataset for Interpretability in Music Models

ConceptCaps:用于音乐模型可解释性的精简概念数据集

Bruno Sienkiewicz, Łukasz Neumann, Mateusz Modrzejewski

机构 * Institute of Computer Science, Warsaw University of Technology(华沙技术大学计算机科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ConceptCaps通过分离语义建模与文本生成,提供一个包含21,000个音乐-标签三元组的数据集,用于提升音乐模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19414 2026-02-05 cs.AI cs.LG 62%

Toward Multiphysics-Informed Machine Learning for Sustainable Data Center Operations: Intelligence Evolution with Deployable Solutions for Computing Infrastructure

迈向可持续数据中心运营的多物理场指导机器学习:面向计算基础设施的可部署解决方案的智能演进

Ruihang Wang, Qingang Zhang, Yonggang Wen, Stuart Kennedy

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多物理场指导机器学习框架,用于提升数据中心运营的可持续性,通过整合物理先验与数据驱动模型,实现碳感知IT资源配置、智能冷却控制等关键应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04570 2026-02-05 cs.CL 57%

Can LLMs capture stable human-generated sentence entropy measures?

大语言模型能否捕捉到稳定的人生成句子熵度量?

Estrella Pivel-Villanueva, Elisabeth Frederike Sterner, Franziska Knolle

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过实验证明大语言模型在捕捉人类生成句子熵方面的能力,发现GPT-4o与人类数据最一致,但LLMs无法完全替代稳定的人类分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13580 2026-02-05 cs.CL 57%

Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models

稀疏子网络增强用于大型语言模型中资源匮乏语言

Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信人工智能研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过稀疏子网络增强方法,提升大型语言模型在资源匮乏语言上的性能,同时保持通用能力,并展示了其在多个语言模型上的有效性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04517 2026-02-05 cs.CV cs.RO 50%

S-MUSt3R: Sliding Multi-view 3D Reconstruction

S-MUSt3R:滑动多视角三维重建

Leonid Antsfeld, Boris Chidlovskii, Yohann Cabon, Vincent Leroy, Jerome Revaud

专题命中 其他安全 :alignment(abstract)

AI总结 S-MUSt3R通过序列分割和轻量级优化实现高效单目三维重建,利用MUSt3R模型在大规模RGB流中实现高精度重建。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04047 2026-02-05 cs.HC 50%

From Crafting Text to Crafting Thought: Grounding AI Writing Support to Writing Center Pedagogy

从文本创作到思维创作:将AI写作支持 grounded 到写作中心教学法

Yijun Liu, John Gallagher, Sarah Sterman, Tal August

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出Writor工具,旨在通过目标设定、平衡反馈和对话来支持写作,而非直接生成文本,以促进学生批判性思维和保留其声音。

Comments Conditionally accepted to CHI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11103 2026-02-05 cs.HC 50%

AI Twin: Enhancing ESL Speaking Practice through AI Self-Clones of a Better Me

AI Twin: 通过AI自我克隆的更好我提升英语口语练习

Minju Park, Seunghyun Lee, Juhwan Ma, Dongwook Yoon

专题命中 其他安全 :alignment(abstract)

AI总结 AI Twin通过AI自我克隆提升ESL口语练习,利用隐含反馈增强学习者动机与语言流畅性。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏