arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-28 至 2026-01-28 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2601.18998 2026-01-28 cs.CL 57%

Malicious Repurposing of Open Science Artefacts by Using Large Language Models

利用大语言模型恶意重用开放科学制品

Zahra Hashemi, Zhiqiang Zhong, Jun Pang, Wei Zhao

机构 * University of Luxemburg(卢森堡大学) University of Aberdeen(阿伯丁大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文研究了利用大语言模型恶意重用开放科学制品生成有害研究的可能性,通过端到端流程揭示LLMs在恶意评估中的局限性,强调人类评估在双用途风险评估中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10246 2026-01-28 cs.CL 57%

coTherapist: A Behavior-Aligned Small Language Model to Support Mental Healthcare Experts

coTherapist:一种行为对齐的小语言模型,用于支持心理健康专家

Prottay Kumar Adhikary, Reena Rawat, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 coTherapist通过小语言模型和领域微调等技术,为心理健康专家提供支持,展现出高同理心和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11254 2026-01-28 cs.CL 57%

Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality

心理测试在大语言模型中是否有效?对性别歧视、种族主义和道德的测试评估

Jana Jung, Marlene Lutz, Indira Sen, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究评估了心理测试在大语言模型上的有效性,发现其在性别歧视、种族主义和道德方面的测试分数与模型行为不一致,表明需进一步调整以适应LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12344 2026-01-28 cs.CL 57%

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

宣传AI:大型语言模型中语义分歧的分析

Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出RAVEN方法,用于检测大型语言模型中因概念提示引发的语义分歧,通过结合语义熵与跨模型分歧,揭示模型在特定主题上的异常响应,以提高对宣传影响的防范能力。

Comments Accepted at ICLR 2026, 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18900 2026-01-28 cs.CV cs.LG stat.ML 57%

RealStats: A Rigorous Real-Only Statistical Framework for Fake Image Detection

RealStats: 一种用于伪造图像检测的严谨实数统计框架

Haim Zisman, Uri Shaham

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 RealStats提出了一种基于统计学的无训练框架,通过整合多种检测器的无训练统计量,生成可解释的实图像概率评分,以提高伪造图像检测的鲁棒性。

Comments 22 pages, 14 figures. Accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19898 2026-01-28 cs.CV 50%

DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding

DuwatBench: 通过阿拉伯书法基准桥接语言与视觉遗产以实现多模态理解

Shubham Patle, Sara Ghaboura, Hania Tariq, Mohammad Usman Khan, Omkar Thawakar, Rao Muhammad Anwer, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) NUCES(努赛斯大学) NUST(努斯特大学) Australian National University(澳大利亚国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 DuwatBench通过阿拉伯书法基准推动多模态研究,揭示多模态模型在处理书法变体和艺术扭曲时的局限性。

Comments Accepted to EACL-2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV 50%

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

专题命中 安全评测 :alignment(abstract)

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19345 2026-01-28 cs.CR 50%

AI-driven Intrusion Detection for UAV in Smart Urban Ecosystems: A Comprehensive Survey

基于人工智能的无人机智能城市生态系统入侵检测:综述

Abdullah Khanfor, Raby Hamadi, Noureddine Lasla, Hakim Ghazzai

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了无人机在智能城市中的应用及安全挑战,探讨了人工智能技术在入侵检测中的作用,并提出了十个关键研究方向。

Comments 68 pages, 13 figures, 6 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19287 2026-01-28 cs.SE 50%

Understanding Dominant Themes in Reviewing Agentic AI-authored Code

理解代理AI生成代码的主导主题

Md. Asif Haider, Thomas Zimmermann

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了代理AI生成代码的评审主题,通过大规模实证分析发现,评审主要关注文档、重构和格式问题,而非功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2601.19280 2026-01-28 cs.LG cs.AI cs.CL 67%

Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning

基于组分布鲁棒优化的强化学习用于大语言模型推理

Kishan Panaganti, Zhenwen Liang, Wenhao Yu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab in Bellevue WA USA(腾讯AI实验室(西雅图华盛顿州))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多对手组分布鲁棒优化框架,通过动态调整训练分布提升大语言模型推理性能,实现训练后精度提升10.6%和10.1%。

Comments Keywords: Large Language Models, Reasoning Models, Reinforcement Learning, Distributionally Robust Optimization, GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14401 2026-01-28 cs.MA cs.AI 57%

The Role of Social Learning and Collective Norm Formation in Fostering Cooperation in LLM Multi-Agent Systems

在LLM多智能体系统中,社会学习和集体规范形成促进合作的作用

Prateek Gupta, Qiankun Zhong, Hiromu Yakura, Thomas Eisenmann, Iyad Rahwan

机构 * Center for Humans and Machines(人类与机器中心) Max-Planck Institute for Human Development(人类发展马克斯·普朗克研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种无显式奖励信号的CPR模拟框架,通过社会学习和规范惩罚机制研究LLM多智能体系统中合作与规范的内生形成。

Comments Accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 15 篇

2506.08512 2026-01-28 cs.CV cs.AI 79%

MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding

MLVTG: 基于Mamba的特征对齐与LLM驱动的多模态视频时间定位

Zhiyi Zhu, Xiaoyu Wu, Zihao Liu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 MLVTG通过结合MambaAligner和LLMRefiner,实现了多模态视频时间定位的高精度定位与语义净化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19247 2026-01-28 cs.CV 78%

TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment

TIGaussian: 解耦高斯分布以实现空间感知的图文-3D对齐

Jiarun Liu, Qifeng Chen, Yiru Zhao, Minghua Liu, Baorui Ma, Sheng Yang

机构 * Unmanned Vehicle Dept., Cainiao Inc., Alibaba Group, Hangzhou, China(阿里巴巴集团 Cainiao 无人机部门,杭州,中国) Hillbot, Sunnyvale, USA(Hillbot,美国 Sunnyvale) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 其他安全 :alignment(title,abstract)

AI总结 TIGaussian通过多分支3DGS分词器和模态特定对齐策略,实现空间感知的图文-3D跨模态对齐,提升3D相关任务的预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15600 2026-01-28 cs.AI cs.CL 62%

Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism

通过结构化组件奖励机制解锁生物实验协议生成中的科学推理

Haoran Sun, Yankai Jiang, Zhenyu Tang, Yaning Pan, Shuang Gu, Zekai Lin, Lilong Wang, Wenjie Lou, Lei Liu, Lei Bai, Xiaosong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过结构化组件奖励机制,Thoth在多个基准测试中超越了现有LLMs,实现了更准确的生物实验协议生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15580 2026-01-28 cs.LG cs.CL 62%

Language Models are Symbolic Learners in Arithmetic

语言模型在算术中是符号学习者

Chunyuan Deng, Zhiqi Li, Roy Xie, Ruidi Chang, Hanjie Chen

机构 * Department of Computer Science(计算机科学系) Rice University(里士满大学) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究语言模型在算术运算中通过学习符号捷径而非算法来掌握算术能力。

Comments TMLR 2026. Code at https://github.com/chili-lab/Symbolic-Arithmetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19825 2026-01-28 cs.AI cs.DB 57%

Routing End User Queries to Enterprise Databases

将用户查询路由到企业数据库

Saikrishna Sudarshan, Tanay Kulkarni, Manasi Patwardhan, Lovekesh Vig, Ashwin Srinivasan, Tanmay Tulsidas Verlekar

机构 * TCS Research(TCS研究机构) Department of CSIS, BITS Pilani KK Birla Goa Campus(计算机科学与信息系统系,比斯科恩理工学院KK Birla Goa校区)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种基于推理的重新排序策略,通过建模模式覆盖、结构连接性和语义对齐,提升多数据库环境中自然语言查询路由的准确性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19170 2026-01-28 cs.AI 57%

Multi-Agent Procedural Graph Extraction with Structural and Logical Refinement

多代理过程图提取与结构逻辑细化

Wangyang Ying, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Wenchao Yu, Yanjie Fu, Haifeng Chen

机构 * Arizona State University(亚利桑那州立大学) NEC Labs America(NEC美国实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出多代理框架\model{},通过结构和逻辑细化提升过程图提取的准确性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06201 2026-01-28 cs.LG 57%

K2-V2: A 360-Open, Reasoning-Enhanced LLM

K2-V2:一种360开放、推理增强的LLM

K2 Team, Zhengzhong Liu, Liping Tang, Linghao Jin, Haonan Li, Nikhil Ranjan, Desai Fan, Shaurya Rohatgi, Richard Fan, Omkar Pangarkar, Huijuan Wang, Zhoujun Cheng, Suqi Sun, Seungwook Han, Bowen Tan, Gurpreet Gosal, Xudong Han, Varad Pimpalkhute, Shibo Hao, Ming Shan Hee, Joel Hestness, Haolong Jia, Liqun Ma, Aaryamonvikram Singh, Daria Soboleva, Natalia Vassilieva, Renxi Wang, Yingquan Wu, Yuekai Sun, Taylor Killian, Alexander Moreno, John Maggs, Hector Ren, Guowei He, Hongyi Wang, Xuezhe Ma, Yuqi Wang, Mikhail Yurochkin, Eric P. Xing

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 K2-V2是一种通过注入领域知识、推理、长上下文和工具使用能力,提升复杂推理任务性能的360开放LLM,具备强大的推理能力和开源训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24940 2026-01-28 cs.CL 57%

SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens

SemCoT:通过语义对齐的隐式令牌加速链式推理

Yinhan He, Wendy Zheng, Yaochen Zhu, Zaiyi Zheng, Lin Su, Sriram Vasudevan, Qi Guo, Liangjie Hong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) LinkedIn Inc.(领英公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 SemCoT通过语义对齐的隐式令牌优化,提升链式推理的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06297 2026-01-28 cs.LG 57%

LoaQ: Layer-wise Output Approximation Quantization

LoaQ: 层级输出近似量化

Li Lin, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究所,北京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 LoaQ通过引入输出匹配因素,改进了基于层级的后训练量化方法,提升了模型量化质量并具有简洁的闭式解。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18939 2026-01-28 cs.LG 57%

A Few Bad Neurons: Isolating and Surgically Correcting Sycophancy

几个坏神经元:隔离并外科手术性纠正阿谀行为

Claire O'Brien, Jessica Seto, Dristi Roy, Aditya Dwivedi, Sunishchal Dev, Kevin Zhu, Sean O'Brien, Ashwinee Panda, Ryan Lagasse

机构 * Algoverse RAND Meta FAIR University of Maryland(马里兰大学) Lockheed Martin AI Center(洛克希德·马丁人工智能中心)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过隔离并微调最负责特定行为的神经元来实现LLM行为对齐,展示了在减少阿谀行为任务上的有效性。

Comments Accepted to NeurIPS Workshop on CogInterp and NeurIPS Workshop on Reliable ML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19387 2026-01-28 cs.SE cs.HC 50%

Bridging the Socio-Emotional Gap: The Functional Dimension of Human-AI Collaboration for Software Engineering

弥合社会情感鸿沟:面向软件工程的人机协作的功能维度

Lekshmi Murali Rani, Richard Berntsson Svensson, Robert Feldt

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了人机协作中社会情感鸿沟问题,提出通过功能等效设计实现有效协作,而非复制人类情感智能特征。

Comments This is the authors accepted manuscript. The final version appears in ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19119 2026-01-28 cs.RO 50%

Agree to Disagree: Consensus-Free Flocking under Constraints

同意却分歧:在约束下无需共识的编队

Peter Travis Jardine, Sidney Givigi

机构 * School of Computing, Queen’s University(女王大学计算机学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出了一种无需共识的编队方法,通过局部观察实现参数协商,以应对智能体间冲突目标和约束条件下的协调运动。

Comments 7 pages. This work has been accepted for publication in the Proceedings of IEEE SYSCON 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05895 2026-01-28 cs.CV 50%

BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model

BTCChat: 通过多模态大语言模型推进遥感双时相变化描述

Yujie Li, Wenjia Xu, Yuanben Zhang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Aerospace Information Research Institute(航天信息研究所) Chinese Academy of Sciences(中国科学院) School of Geographical Sciences(地理科学学院) Hunan Normal University(湖南师范大学)

专题命中 其他安全 :alignment(abstract)

AI总结 BTCChat通过多模态大语言模型提升遥感双时相变化描述能力,引入变化提取模块和提示增强机制,实现更精确的视觉-语义对齐和更优的性能表现。

Comments 5 pages, 2 figures; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20497 2026-01-28 physics.soc-ph physics.data-an 50%

Scaling Pedestrian Crossing Analysis to 100 U.S. Cities via AI-based Segmentation of Satellite Imagery

通过基于AI的卫星图像分割将行人过街分析扩展到美国100个城市

Marcel Moran, Arunav Gupta, Jiali Qian, Debra Laefer

专题命中 其他安全 :safety(abstract)

AI总结 通过AI分割卫星图像,研究者准确测量了美国100大城市中行人过街距离,发现其与城市成立年份正相关,揭示了城市设计趋势。

Comments 12 figures, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18966 2026-01-28 cs.HC 50%

People Can Accurately Predict Behavior of Complex Algorithms That Are Available, Compact, and Aligned

人们可以准确预测可获得、紧凑且对齐的复杂算法的行为

Lindsay Popowski, Helena Vasconcelos, Ignacio Javier Fernandez, Chijioke Chinaza Mgbahurike, Ralf Herbrich, Jeffrey Hancock, Michael S. Bernstein

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出用户能准确预测复杂算法行为的三个条件:认知可用性、概念紧凑性和高对齐度,并通过实验验证了这些条件对预测准确性和心理模型的影响。

Comments 41 pages, 9 figures; this work to appear in PACMHCI V10, N2, April 2026 and be presented at the 29th ACM SIGCHI Conference on Computer-Supported Cooperative Work & Social Computing (CSCW)

详情

展开后加载摘要…

URL PDF HTML 收藏