arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-05 至 2026-02-05 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2602.02515 2026-02-05 cs.AI cs.CL cs.LG 67%

CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection

CreditAudit: 2维度用于LLM评估与选择

Yiliang Song, Hongjun An, Jiangong Xiao, Haofei Zhao, Jiawei Shao, Xuelong Li

机构 * Northwestern Polytechnical University Institute of Artificial Intelligence (TeleAI), China Telecom(西北工业大学人工智能研究所(TeleAI),中国电信) Dalian Maritime University Institute of Artificial Intelligence (TeleAI), China Telecom(大连海事大学人工智能研究所(TeleAI),中国电信) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Guangxi Normal University Institute of Artificial Intelligence (TeleAI), China Telecom(广西师范大学人工智能研究所(TeleAI),中国电信)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CreditAudit 通过 2D 信用评级框架,提供基于稳定性风险的 LLM 部署评估方法,支持更精确的模型选择与分层部署。

Comments Second update

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04033 2026-02-05 cs.CL cs.AI cs.CY 67%

On the Credibility of Evaluating LLMs using Survey Questions

关于通过调查问题评估LLM可信度的研究

Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查尔斯大学,数学与物理学院,形式与应用语言学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过调查问题评估LLM可信度,发现提示方法和解码策略显著影响结果,并引入自相关距离度量标准以评估答案一致性。

Comments Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY 62%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 62%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02619 2026-02-05 cs.LG cs.AI cs.SE 62%

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

daVinci-Agency: 解锁长周期代理数据高效性

Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04617 2026-02-05 cs.CL 57%

LEAD: Layer-wise Expert-aligned Decoding for Faithful Radiology Report Generation

LEAD:逐层专家对齐解码以生成准确的放射学报告

Ruixiao Yang, Yuanhe Tian, Xu Yang, Huiqi Li, Yan Song

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 LEAD通过逐层专家对齐解码方法,提升放射学报告生成的准确性并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04152 2026-02-05 cs.RO cs.AI 57%

MA3DSG: Multi-Agent 3D Scene Graph Generation for Large-Scale Indoor Environments

MA3DSG:多智能体3D场景图生成用于大规模室内环境

Yirum Kim, Jaewoo Kim, Ue-Hwan Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合学院,全州科学技术院(GIST))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MA3DSG通过多智能体协作实现大规模室内环境的3D场景图生成,无需训练参数即可提升扩展性与协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04131 2026-02-05 cs.LG 57%

Decoupling Time and Risk: Risk-Sensitive Reinforcement Learning with General Discounting

解耦时间和风险:具有通用折扣的风险敏感强化学习

Mehrdad Moghimi, Anthony Coache, Hyejin Ku

机构 * Dept. of Mathematics and Statistics(数学与统计学系) York University(约克大学) Dept. of Mathematics(数学系) Imperial College(帝国理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种支持灵活折扣和风险度量优化的新型分布式强化学习框架,通过技术分析和实验验证,展示了折扣在捕捉时空和风险偏好中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04064 2026-02-05 cs.CY 57%

The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks

公民查询基准:一种新的数据集和评估流程,用于衡量LLM在公民查询任务中的性能

Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文提出CitizenQuery-UK数据集和评估流程,用于评估LLM在公民查询任务中的可信度,发现模型在事实性、回避率和冗余性方面存在差异,强调了可信赖AI的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04535 2026-02-05 cs.SD 50%

HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing

HoliAntiSpoof: 面向整体语音反伪装的音频大语言模型

Xuenan Xu, Yiming Ren, Liwei Liu, Wen Wu, Baoxiang Li, Chaochao Lu, Shuai Wang, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 HoliAntiSpoof通过音频大语言模型实现整体语音反伪装分析,通过统一文本生成任务提升检测性能并实现可解释的语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03878 2026-02-05 cs.CV cs.CR 50%

Intellectual Property Protection for 3D Gaussian Splatting Assets: A Survey

3D高斯散射资产的知识产权保护:一篇综述

Longjie Zhao, Ziming Hong, Jiaxin Huang, Runnan Chen, Mingming Gong, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) The University of Melbourne(墨尔本大学) Mohamed bin Zayed University of Artificial Intelligence(莫莫迪·本·扎耶德人工智能大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了3D高斯散射资产的知识产权保护,分析了其底层机制、保护范式及鲁棒性挑战,并提出了六个研究方向以推动可靠保护技术的发展。

Comments A collection of relevant papers is summarized and will be continuously updated at \url{https://github.com/tmllab/Awesome-3DGS-IP-Protection}

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2602.04742 2026-02-05 cs.CY cs.CL 73%

Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models

推理时的推理选择性减少大语言模型中的隐性社会偏见

Molly Apsel, Michael N. Jones

机构 * Cognitive Science Program Department of Psychological & Brain Sciences Indiana University Bloomington(心理与脑科学系认知科学计划印第安纳大学布卢明顿)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 该研究通过推理增强减少大语言模型中的隐性社会偏见,揭示推理对公平性评估的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12300 2026-02-05 cs.CY cs.AI 62%

Mutually Assured Deregulation

相互保障的去监管

Gilad Abiri

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文指出,去监管反而会加剧安全风险,强调需加强监管以应对人工智能带来的国家安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 11 篇

2602.03849 2026-02-05 cs.HC cs.AI cs.CL cs.LG 67%

HybridQuestion: Human-AI Collaboration for Identifying High-Impact Research Questions

HybridQuestion: 人机协作识别高影响力研究问题

Keyu Zhao, Fengli Xu, Yong Li, Tie-Yan Liu

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、北京理工大学、清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HybridQuestion通过人机协作识别高影响力研究问题,利用AI处理数据与人类判断结合,验证了在科学突破和未来问题预测中的有效性。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21436 2026-02-05 cs.LG cs.AI cs.CL cs.CV 67%

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

从一致性到互补性:面向时间序列理解和推理的对齐与解缠多模态学习

Hang Ni, Weijia Zhang, Fei Wang, Zezhi Shao, Hao Liu

机构 * The Hong Kong University of Science(香港科学与技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MADI通过细粒度对齐和解缠交互提升多模态时间序列理解和推理能力,实现更精确的数值-视觉模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04116 2026-02-05 cs.LG cs.AI cs.SI 62%

Toward Effective Multimodal Graph Foundation Model: A Divide-and-Conquer Based Approach

迈向有效的多模态图基础模型:基于分而治之的方法

Sicheng Liu, Xunkai Li, Daohan Su, Ru Zhang, Hongchao Qin, Ronghua Li, Guoren Wang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 PLANET提出了一种基于分而治之的方法,通过解耦模态交互和对齐,提升多模态图基础模型的性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04074 2026-02-05 cs.LG cs.CL 62%

Stroke Lesions as a Rosetta Stone for Language Model Interpretability

中风病变作为语言模型可解释性的一种罗塞塔石碑

Julius Fridriksson, Roger D. Newman-Norlund, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Xiang Guan, Yong Yang, Srihari Nelakuditi, Rutvik Desai, Leonardo Bonilha, Jeff Charney, Chris Rorden

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 中风病变被用于验证语言模型的可解释性,通过比较模型扰动与人类病变模式,揭示语言处理的共享计算原则。

Comments 45 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14157 2026-02-05 cs.SD cs.AI cs.LG 62%

ConceptCaps: a Distilled Concept Dataset for Interpretability in Music Models

ConceptCaps:用于音乐模型可解释性的精简概念数据集

Bruno Sienkiewicz, Łukasz Neumann, Mateusz Modrzejewski

机构 * Institute of Computer Science, Warsaw University of Technology(华沙技术大学计算机科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ConceptCaps通过分离语义建模与文本生成,提供一个包含21,000个音乐-标签三元组的数据集,用于提升音乐模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19414 2026-02-05 cs.AI cs.LG 62%

Toward Multiphysics-Informed Machine Learning for Sustainable Data Center Operations: Intelligence Evolution with Deployable Solutions for Computing Infrastructure

迈向可持续数据中心运营的多物理场指导机器学习:面向计算基础设施的可部署解决方案的智能演进

Ruihang Wang, Qingang Zhang, Yonggang Wen, Stuart Kennedy

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多物理场指导机器学习框架,用于提升数据中心运营的可持续性,通过整合物理先验与数据驱动模型,实现碳感知IT资源配置、智能冷却控制等关键应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04570 2026-02-05 cs.CL 57%

Can LLMs capture stable human-generated sentence entropy measures?

大语言模型能否捕捉到稳定的人生成句子熵度量?

Estrella Pivel-Villanueva, Elisabeth Frederike Sterner, Franziska Knolle

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过实验证明大语言模型在捕捉人类生成句子熵方面的能力,发现GPT-4o与人类数据最一致,但LLMs无法完全替代稳定的人类分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13580 2026-02-05 cs.CL 57%

Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models

稀疏子网络增强用于大型语言模型中资源匮乏语言

Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信人工智能研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过稀疏子网络增强方法,提升大型语言模型在资源匮乏语言上的性能,同时保持通用能力,并展示了其在多个语言模型上的有效性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04517 2026-02-05 cs.CV cs.RO 50%

S-MUSt3R: Sliding Multi-view 3D Reconstruction

S-MUSt3R:滑动多视角三维重建

Leonid Antsfeld, Boris Chidlovskii, Yohann Cabon, Vincent Leroy, Jerome Revaud

专题命中 其他安全 :alignment(abstract)

AI总结 S-MUSt3R通过序列分割和轻量级优化实现高效单目三维重建,利用MUSt3R模型在大规模RGB流中实现高精度重建。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04047 2026-02-05 cs.HC 50%

From Crafting Text to Crafting Thought: Grounding AI Writing Support to Writing Center Pedagogy

从文本创作到思维创作:将AI写作支持 grounded 到写作中心教学法

Yijun Liu, John Gallagher, Sarah Sterman, Tal August

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出Writor工具,旨在通过目标设定、平衡反馈和对话来支持写作,而非直接生成文本,以促进学生批判性思维和保留其声音。

Comments Conditionally accepted to CHI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11103 2026-02-05 cs.HC 50%

AI Twin: Enhancing ESL Speaking Practice through AI Self-Clones of a Better Me

AI Twin: 通过AI自我克隆的更好我提升英语口语练习

Minju Park, Seunghyun Lee, Juhwan Ma, Dongwook Yoon

专题命中 其他安全 :alignment(abstract)

AI总结 AI Twin通过AI自我克隆提升ESL口语练习,利用隐含反馈增强学习者动机与语言流畅性。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏