arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-21 至 2026-01-21 共收录 25 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 25 篇

2601.12962 2026-01-21 cs.CY 79%

ACE-Align: Attribute Causal Effect Alignment for Cultural Values under Varying Persona Granularities

ACE-Align:属性因果效应对齐用于不同人格粒度下的文化价值观

Jiatang Luo, Bingbing Xu, Rongxin Chen, Xiaoyan Zhao, Yang Zhang, Liang Pang, Zhiyong Huang, Tat-Seng Chua, Huawei Shen

专题命中 其他安全 :alignment(title,abstract);分类 cs.CY

AI总结 ACE-Align通过属性因果效应对齐,提升不同人格粒度下文化价值观的公平性,减少高低资源地区差距。

Comments 18 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19678 2026-01-21 eess.SY cs.SY 78%

Distributed Safety-Critical MPC for Multi-Agent Formation Control and Obstacle Avoidance

分布式安全关键MPC用于多智能体编队控制与障碍规避

Chao Wang, Shuyuan Zhang, Lei Wang

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出了一种分布式安全关键MPC算法,通过高阶控制屏障函数和控制Lyapunov函数实现多智能体编队控制与障碍规避,提升了系统的安全性和效率。

Comments Accepted for presentation at the 64th IEEE Conference on Decision and Control (CDC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12812 2026-01-21 cs.CL 70%

Do Clinical Question Answering Systems Really Need Specialised Medical Fine Tuning?

临床问答系统真的需要专门的医学微调吗?

Sushant Kumar Ray, Gautam Siddharth Kashyap, Sahil Tripathi, Nipun Joshi, Vijay Govindarajan, Rafiq Ali, Jiechao Gao, Usman Naseem

机构 * University of Delhi(德里大学) Jamia Hamdard(贾迈亚哈马尔德大学) Cornell University(康奈尔大学) Expedia Group(Expedia集团) DSEU-Okhla Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MEDASSESS-X通过推理时对齐技术,无需领域微调即可提升临床问答系统性能,解决专门化谬误问题。

Comments Accepted at EACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13709 2026-01-21 cs.AI cs.CL cs.CY cs.HC cs.SI 67%

Hidden in Plain Text: Measuring LLM Deception Quality Against Human Baselines Using Social Deduction Games

隐藏在 plain 文本中:使用社会推断游戏测量 LLM 欺骗质量 against 人类基准

Christopher Kao, Vanshika Vats, James Davis

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过社会推断游戏测量 LLM 欺骗能力,发现 LLM 在欺骗人类时表现更优,但其欺骗质量低于人类。

Comments For associated dataset, see https://github.com/cocochief4/llm-mafia. Published in IEEE ICA 2025, waiting for IEEEXplore proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-01-21 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12785 2026-01-21 cs.LG cs.AI 62%

Distilling Time Series Foundation Models for Efficient Forecasting

压缩时间序列基础模型以实现高效预测

Yuqi Li, Kuiye Ding, Chuanguang Yang, Szu-Yu Chen, Yingli Tian

机构 * The City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) Stevens Institute of Technology, USA(史蒂文斯理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DistilTS是一种专为时间序列基础模型设计的蒸馏框架,通过时间跨度加权目标和时间对齐策略,在减少参数量的同时保持预测性能。

Comments Accepted by ICASSP-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12711 2026-01-21 cs.AI cs.LG cs.SC 62%

Neurosymbolic LoRA: Why and When to Tune Weights vs. Rewrite Prompts

神经符号LoRA:为何以及何时调整权重 versus 重写提示

Kevin Wang, Neel P. Bhatt, Cong Liu, Junbo Li, Runjin Chen, Yihan Xi, Timothy Barclay, Alvaro Velasquez, Ufuk Topcu, Zhangyang Wang

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 神经符号LoRA结合数值和符号更新,提升语言模型微调的适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05178 2026-01-21 cs.LG cs.AI cs.SC 62%

Auditable Unit-Aware Thresholds in Symbolic Regression via Logistic-Gated Operators

可审计的单元感知阈值在通过逻辑门运算符进行的符号回归中

Ou Deng, Ruichen Cong, Jianting Xu, Shoji Nishimura, Atsushi Ogihara, Qun Jin

机构 * Faculty of Human Sciences, Waseda University(早稻田大学人类科学系) Graduate School of Human Sciences, Waseda University(早稻田大学人类科学研究院)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 LGO通过逻辑门运算符实现符号回归,将阈值提升为单元感知参数,提高医疗领域模型的可审计性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11560 2026-01-21 cs.IR cs.AI cs.LG 62%

DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research

DeepEvidence: 通过深度知识图谱研究赋能生物医学发现

Zifeng Wang, Zheng Chen, Ziwei Yang, Xuan Wang, Qiao Jin, Yifan Peng, Zhiyong Lu, Jimeng Sun

机构 * Keiji AI Institute of Scientific and Industrial Research, Osaka University(大阪大学科学工业研究所) Bioinformatics Center, Institute for Chemical Research, Kyoto University(京都大学化学研究所生物信息中心) Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家卫生研究院生物医学图书馆内部研究部) Department of Population Health Sciences, Weill Cornell Medicine(韦尔·科恩医学中心流行病学与健康科学系) School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DeepEvidence通过深度知识图谱研究框架,系统化地连接异构生物医学资源,提升科学发现的效率和证据综合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14091 2026-01-21 cs.RO cs.AI 57%

Zero-shot adaptable task planning for autonomous construction robots: a comparative study of lightweight single and multi-AI agent systems

零样本适应性任务规划用于自主建造机器人:轻量级单 agent 和多 agent 系统的比较研究

Hossein Naderi, Alireza Shojaei, Lifu Huang, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究通过比较轻量级单 agent 和多 agent 系统,探索了零样本适应性任务规划在自主建造机器人中的应用,展示了四 agent 团队在效率和成本上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14007 2026-01-21 cs.CL 57%

BACH-V: Bridging Abstract and Concrete Human-Values in Large Language Models

BACH-V: 联结抽象与具体的人类价值观在大语言模型中

Junyu Zhang, Yipeng Kang, Jiong Guo, Jiayu Zhan, Junqi Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 BACH-V研究通过探测和引导方法揭示大语言模型中抽象与具体价值观的联结机制,发现其能稳定锚定抽象价值观以影响具体决策。

Comments 34 pagess, 16 figures, 6 tables, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13995 2026-01-21 cs.CL 57%

From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning

从标签到树:为LLM指令微调中的可控数据选择构建细粒度知识

Zihan Niu, Wenping Hu, Junmin Chen, Xiyue Wang, Tong Xu, Ruiming Tang

机构 * University of Science and Technology of China(中国科学技术大学) Klear Team, Kuaishou Technology(快手科技Klear团队)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 TAGS通过构建细粒度知识树,实现LLM指令微调中可控数据选择的高效采样与知识对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03648 2026-01-21 cs.CL 57%

ELO: Efficient Layer-Specific Optimization for Continual Pretraining of Multilingual LLMs

ELO:面向多语言大语言模型持续预训练的高效分层优化

HanGyeol Yoo, ChangSu Choi, Minjun Kim, Seohyun Song, SeungWoo Song, Inho Won, Jongyoul Park, Cheoneum Park, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) LG CNS Korea Advanced Institute of Science and Technology(韩国科学技术院) Hanbat National University(汉 bat 国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 ELO通过分层优化提升多语言大模型持续预训练效率,实现6.46倍加速和6.2%性能提升。

Comments 12 pages, Accepted to EACL 2026 (Industrial Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12234 2026-01-21 cs.GR cs.AI cs.CV 57%

Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models

Proc3D: 基于大语言模型的3D形状过程生成与参数编辑

Fadlullah Raji, Stefano Petrangeli, Matheus Gadelha, Yu Shen, Uttaran Bhattacharya, Gang Wu

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Proc3D利用大语言模型实现3D形状的可编辑生成,通过参数化编辑提升设计效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11688 2026-01-21 cs.SE cs.AI 57%

SpecMap: Hierarchical LLM Agent for Datasheet-to-Code Traceability Link Recovery in Systems Engineering

SpecMap:用于系统工程中datasheet到代码可追溯性链接恢复的分层LLM代理

Vedant Nipane, Pulkit Agrawal, Amit Singh

机构 * H2LooP.ai(H2LooP人工智能研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SpecMap通过分层LLM代理实现嵌入式系统datasheet到代码的可追溯性链接恢复,提升映射精度与效率,支持自动化分析与下游应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11666 2026-01-21 cs.CV cs.AI 57%

MATEX: Multi-scale Attention and Text-guided Explainability of Medical Vision-Language Models

MATEX: 医疗视觉-语言模型的多尺度注意力与文本引导可解释性

Muhammad Imran, Chi Lee, Yugyung Lee

机构 * Computer Science, School of Science and Engineering(科学与工程学院计算机科学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MATEX通过多尺度注意力与文本引导方法提升医疗视觉-语言模型的可解释性,实现更精确和临床相关的梯度归因图。

Comments 12 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11608 2026-01-21 cs.DC cs.AI 57%

Hardware-Aware Reformulation of Convolutions for Efficient Execution on Specialized AI Hardware: A Case Study on NVIDIA Tensor Cores

面向专用AI硬件高效执行的卷积重 formulations:NVIDIA Tensor Cores 的案例研究

Ganesh Bikshandi

机构 * NVIDIA

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种硬件感知的卷积计算重 formulations 方法,通过重写规则在训练后满足专用AI硬件的对齐要求,为高效部署CNN模型提供了新的优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11606 2026-01-21 cs.LG 57%

A Multimodal Data Processing Pipeline for MIMIC-IV Dataset

用于MIMIC-IV数据集的多模态数据处理流程

Farzana Islam Adiba, Varsha Danduri, Fahmida Liza Piya, Ali Abbasi, Mehak Gupta, Rahmatollah Beheshti

机构 * University of Delaware(德克萨斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种用于MIMIC-IV数据集的多模态数据处理流程,旨在提升多模态数据处理效率和研究可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14106 2026-01-21 cs.NI 50%

Communication Technologies for Intelligent Transportation Systems: From Railways to UAVs and Beyond

智能交通系统中的通信技术:从铁路到无人机及更远

Shrief Rizkalla, Adrian Kliks, Nila Bagheri, Miguel A. Bellido-Manganell, Aniruddha Chandra, Anja Dakic, Laura Finarelli, Davy Gaillot, Matti Hamalainen, Ruisi He, Markus Hofer, Sandaruwan Jayaweera, Francesco Linsalata, Konstantin Mikhaylov, Jon M. Peha, Ibrahim Rashdan, Gianluca Rizzo, Abdul Saboor, Martin Schmidhammer, Michal Sybis, Fredrik Tufvesson, Paul Unterhuber, Fernando J. Velez, Evgenii Vinogradov, Michael Walter, Thomas Zemen, Haibin Zhang, Zhengyu Zhang

专题命中 其他安全 :safety(abstract)

AI总结 本文探讨了智能交通系统中通信技术的发展,涵盖铁路、公路、航空和无人机等领域,分析现有技术的局限性,并提出5G、6G和AI驱动网络等新兴技术的整合路径,旨在提升交通系统的互操作性和效率。

Comments 113 pages

Journal ref White Paper: Communication Technologies for Intelligent Transportation Systems: From Railways to UAVs and Beyond, JTIT, pp. 1 to 108, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13886 2026-01-21 cs.CV 50%

Revisiting Multi-Task Visual Representation Learning

重新审视多任务视觉表示学习

Shangzhe Di, Zhonghua Zhai, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI) ByteDance Seed(字节跳动种子)

专题命中 其他安全 :alignment(abstract)

AI总结 MTV框架通过多任务学习结合视觉-语言对比、自监督和密集空间目标,提升空间推理能力的同时保持全局语义理解。

Comments Code: https://github.com/Becomebright/MTV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13440 2026-01-21 cs.CV 50%

Analyzing VLM-Based Approaches for Anomaly Classification and Segmentation

分析基于视觉语言模型的异常分类和分割方法

Mohit Kakda, Mirudula Shri Muthukumaran, Uttapreksha Patel, Lawrence Swaminathan Xavier Prince

机构 * Northeastern University(东北大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文分析了基于视觉语言模型的异常分类和分割方法,探讨了其架构范式、对齐策略及性能评估,为工业质量控制提供了方法选择和未来研究方向的指导。

Comments 10 pages,4 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12820 2026-01-21 cs.CV 50%

A Generalist Foundation Model for Total-body PET/CT Enables Diagnostic Reporting and System-wide Metabolic Profiling

一种通用的基础模型用于全身PET/CT,实现诊断报告和系统层面的代谢分析

Wei Chen, Liang Wu, Shuyi Lu, Yuanyuan Sun, Wenkai Bi, Zilong Yuan, Yaoyao He, Feng Wang, Junchi Ma, Shuyong Liu, Zhaoping Cheng, Xiaoyan Hu, Jianfeng Qiu

专题命中 其他安全 :alignment(abstract)

AI总结 SDF-HOLO是一种用于全身PET/CT的通用基础模型,通过多模态学习实现诊断报告和系统代谢分析,提升医疗影像处理的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12591 2026-01-21 cs.SD eess.AS 50%

SmoothCLAP: Soft-Target Enhanced Contrastive Language\--Audio Pretraining for Affective Computing

SmoothCLAP: 用于情感计算的软目标增强对比语言-音频预训练

Xin Jing, Jiadong Wang, Andreas Triantafyllopoulos, Maurice Gerczuk, Shahin Amiriparian, Jun Luo, Björn Schuller

机构 * CHI -- Chair of Health Informatics, TUM University Hospital, Munich, Germany(健康信息学系,塔尔博特大学医院,德国慕尼黑) Huawei, Netherlands(华为,荷兰) GLAM, Imperial College London, UK(GLAM,伦敦帝国学院,英国)

专题命中 其他安全 :alignment(abstract)

AI总结 SmoothCLAP通过引入软目标和副语言特征,改进了对比语言-音频预训练,以更准确地捕捉情感的连续性,从而提升情感计算任务的性能。

Comments 5 pages, accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12303 2026-01-21 cs.CV 50%

Concepts from Representations: Post-hoc Concept Bottleneck Models via Sparse Decomposition of Visual Representations

表示法中的概念:通过视觉表示的稀疏分解实现事后概念瓶颈模型

Shizhan Gong, Xiaofan Zhang, Qi Dou

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出PCBM-ReD,通过视觉表示的稀疏分解,实现对预训练模型的可解释性增强,提升图像分类任务的准确性和可解释性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20339 2026-01-21 cs.SD 50%

MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model

MMEDIT: 一种基于音频语言模型的多类型音频编辑统一框架

Ye Tao, Wen Wu, Chao Zhang, Mengyue Wu, Shuai Wang, Xuenan Xu

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能莫埃实验室、X-LANCE实验室、上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 其他安全 :alignment(abstract)

AI总结 MMEdit提出一种基于音频语言模型的统一框架,通过扩展任务定义和设计数据合成管道,实现多类型音频编辑的高精度与高保真度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏