arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-21 至 2026-01-21 共收录 131 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 51 篇

2601.13688 2026-01-21 math.OC cs.SY eess.SY 50%

Distributed Coverage Control on Poriferous Surface via Poly-Annulus Conformal Mapping

通过多环共形映射实现多孔表面的分布式覆盖控制

Xun Feng, Chao Zhai

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种基于多环共形映射的分布式覆盖控制方法,通过拓扑等价转换和梯度控制律实现多孔表面的高效覆盖与避障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13452 2026-01-21 cs.MA 50%

A simulation of urban incidents involving pedestrians and vehicles based on Weighted A*

基于加权A*算法的行人与车辆城市事件模拟

Edgar Gonzalez Fernandez

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于加权A*算法的行人与车辆城市事件模拟框架,通过多智能体系统建模,研究环境与行为对碰撞风险和效率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12716 2026-01-21 cs.CR 50%

CellularSpecSec-Bench: A Staged Benchmark for Evidence-Grounded Interpretation and Security Reasoning over 3GPP Specifications

CellularSpecSec-Bench: 一个分阶段的基准,用于基于证据的解释和3GPP规范的保安推理

Ke Xie, Xingyi Zhao, Yiwen Hu, Shuhan Yuan, Tian Xie

专题命中 安全评测 :safety(abstract)

AI总结 CellularSpecSec-Bench通过分阶段基准和统一框架,提升对3GPP规范的解释和安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV 50%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03706 2026-01-21 cs.ET 50%

LLM-enhanced Air Quality Monitoring Interface via Model Context Protocol

基于模型上下文协议的LLM增强空气质量监测接口

Yu-Erh Pan, Ayesha Siddika Nipu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于模型上下文协议的LLM增强空气质量监测接口,通过整合实时传感器数据与对话接口,提升环境监测的准确性和用户友好性。

Comments Accepted at 7th International Symposium on Advanced Electrical and Communication Technologies (ISAECT), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 11 篇

2601.10599 2026-01-21 cs.CY 83%

Institutional AI: A Governance Framework for Distributional AGI Safety

机构AI:分布式AGI安全的治理框架

Federico Pierucci, Marcello Galisai, Marcantonio Syrnikov Bracale, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);分类 cs.CY

AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09212 2026-01-21 cs.CL 79%

Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment

针对对齐偏差:一种基于冲突意识的奖励模型驱动LLM对齐框架

Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang, Xinru Liu

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于冲突意识的框架,通过识别和缓解代理模型与策略间的冲突来提升大语言模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12652 2026-01-21 cs.CY 77%

Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking

大语言模型部署中的伦理风险:医疗伦理“ Jailbreak”评估

Chutian Huang, Dake Cao, Jiacheng Ji, Yunlou Fan, Chengze Yan, Hanhui Xu

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 本文评估了大语言模型在医疗伦理领域面临的安全风险,发现七种主流模型在对抗测试中表现不一,其中Claude-Sonnet-4-Reasoning表现最稳健,而其他五种模型几乎全部失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13122 2026-01-21 cs.AI 70%

Responsible AI for General-Purpose Systems: Overview, Challenges, and A Path Forward

通用系统责任AI:概述、挑战与前行之路

Gourab K Patro, Himanshi Agrawal, Himanshu Gharat, Supriya Panigrahi, Nim Sherpa, Vishal Vaddina, Dagnachew Birru

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文探讨了通用AI系统在责任AI方面的挑战,并提出C2V2需求以指导未来系统的开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11583 2026-01-21 cs.CY cs.AI cs.MA 62%

Bit-politeia: An AI Agent Community in Blockchain

Bit-politeia: 区块链上的一个AI代理社区

Xing Yang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 Bit-politeia通过区块链和AI代理构建公平高效的资源分配系统,以减少传统同行评审中的偏见和资源集中问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11369 2026-01-21 cs.GT cs.AI 57%

Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs

机构AI:通过公共治理图治理多智能体Cournot市场中的LLM合谋

Marcantonio Bracale Syrnikov, Federico Pierucci, Marcello Galisai, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

机构 * DEXAI – Icaro Lab(DEXAI–Icaro实验室) Sapienza University of Rome(罗马大学萨皮恩扎分校) Sant’Anna School of Advanced Studies(圣安娜高级研究学校) VU Amsterdam(阿姆斯特丹自由大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过公共治理图治理多智能体Cournot市场合谋问题,展示机构AI框架在减少合谋行为方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12727 2026-01-21 cs.HC cs.AI 57%

AI-exhibited Personality Traits Can Shape Human Self-concept through Conversations

基于AI表现的人格特质可通过对话影响人类自我概念

Jingshu Li, Tianqi Song, Nattapat Boonprakong, Zicheng Zhu, Yitian Yang, Yi-Chieh Lee

机构 * Computer Science(计算机科学) National University of Singapore(新加坡国立大学) School of Computing(计算学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本研究发现基于AI的人格特质可通过对话影响用户自我概念,揭示了AI在人机交互中的潜在影响及设计启示。

Comments ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09478 2026-01-21 cs.IR cs.AI 57%

Bridging Semantic Understanding and Popularity Bias with LLMs

通过大语言模型弥合语义理解和流行偏见之间的鸿沟

Renqiang Luo, Dong Zhang, Yupeng Gao, Wen Shi, Mingliang Hou, Jiaying Liu, Zhe Wang, Shuo Yu

机构 * Jilin University Changchun China Dalian University of Technology Dalian China Jinan University \& TAL Education Group Guangzhou China Jilin University Dalian University of Technology Jinan University \& TAL Education Group

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出FairLRM框架,通过大语言模型增强对流行偏见的语义理解,提升推荐系统的公平性和准确性。

Comments 10 pages, 4 figs, WWW 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11953 2026-01-21 cs.LG 57%

Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration

在安全探索中约束强化学习中的低估偏差控制

Shiqing Gao, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文提出MICE方法,通过引入内在成本和偏差校正策略,有效控制约束强化学习中的低估偏差,减少约束违反并保持策略性能。

Comments Published in the 42nd International Conference on Machine Learning (ICML 2025, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11576 2026-01-21 cs.CY 57%

What Can Student-AI Dialogues Tell Us About Students' Self-Regulated Learning? An exploratory framework

学生-人工智能对话能告诉我们什么?关于学生自主学习能力的探索性框架

Long Zhang, Fangwei Lin, Weilin Wang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本研究通过分析学生与AI对话日志,提出DHASRL框架,揭示主动对话模式与自主学习能力正相关,而反应性模式则负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15639 2026-01-21 cs.AI 57%

The AI Policy Module: Developing Computer Science Student Competency in AI Ethics and Policy

AI政策模块:培养计算机科学学生在AI伦理与政策方面的能力

James Weichert, Daniel Dunlap, Mohammed Farghally, Hoda Eldardiry

机构 * Computer Science \& Engineering University of Washington Seattle, USA

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出AI政策模块2.0,通过课程改革提升学生在AI伦理与政策方面的素养,通过试点评估显示学生对AI伦理影响的担忧增加,同时增强了讨论AI监管的能力。

Comments Accepted at IEEE Frontiers in Education (FIE) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 25 篇

2601.12962 2026-01-21 cs.CY 79%

ACE-Align: Attribute Causal Effect Alignment for Cultural Values under Varying Persona Granularities

ACE-Align:属性因果效应对齐用于不同人格粒度下的文化价值观

Jiatang Luo, Bingbing Xu, Rongxin Chen, Xiaoyan Zhao, Yang Zhang, Liang Pang, Zhiyong Huang, Tat-Seng Chua, Huawei Shen

专题命中 其他安全 :alignment(title,abstract);分类 cs.CY

AI总结 ACE-Align通过属性因果效应对齐,提升不同人格粒度下文化价值观的公平性,减少高低资源地区差距。

Comments 18 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19678 2026-01-21 eess.SY cs.SY 78%

Distributed Safety-Critical MPC for Multi-Agent Formation Control and Obstacle Avoidance

分布式安全关键MPC用于多智能体编队控制与障碍规避

Chao Wang, Shuyuan Zhang, Lei Wang

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出了一种分布式安全关键MPC算法,通过高阶控制屏障函数和控制Lyapunov函数实现多智能体编队控制与障碍规避,提升了系统的安全性和效率。

Comments Accepted for presentation at the 64th IEEE Conference on Decision and Control (CDC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12812 2026-01-21 cs.CL 70%

Do Clinical Question Answering Systems Really Need Specialised Medical Fine Tuning?

临床问答系统真的需要专门的医学微调吗?

Sushant Kumar Ray, Gautam Siddharth Kashyap, Sahil Tripathi, Nipun Joshi, Vijay Govindarajan, Rafiq Ali, Jiechao Gao, Usman Naseem

机构 * University of Delhi(德里大学) Jamia Hamdard(贾迈亚哈马尔德大学) Cornell University(康奈尔大学) Expedia Group(Expedia集团) DSEU-Okhla Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MEDASSESS-X通过推理时对齐技术,无需领域微调即可提升临床问答系统性能,解决专门化谬误问题。

Comments Accepted at EACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13709 2026-01-21 cs.AI cs.CL cs.CY cs.HC cs.SI 67%

Hidden in Plain Text: Measuring LLM Deception Quality Against Human Baselines Using Social Deduction Games

隐藏在 plain 文本中:使用社会推断游戏测量 LLM 欺骗质量 against 人类基准

Christopher Kao, Vanshika Vats, James Davis

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过社会推断游戏测量 LLM 欺骗能力,发现 LLM 在欺骗人类时表现更优,但其欺骗质量低于人类。

Comments For associated dataset, see https://github.com/cocochief4/llm-mafia. Published in IEEE ICA 2025, waiting for IEEEXplore proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-01-21 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12785 2026-01-21 cs.LG cs.AI 62%

Distilling Time Series Foundation Models for Efficient Forecasting

压缩时间序列基础模型以实现高效预测

Yuqi Li, Kuiye Ding, Chuanguang Yang, Szu-Yu Chen, Yingli Tian

机构 * The City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) Stevens Institute of Technology, USA(史蒂文斯理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DistilTS是一种专为时间序列基础模型设计的蒸馏框架,通过时间跨度加权目标和时间对齐策略,在减少参数量的同时保持预测性能。

Comments Accepted by ICASSP-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12711 2026-01-21 cs.AI cs.LG cs.SC 62%

Neurosymbolic LoRA: Why and When to Tune Weights vs. Rewrite Prompts

神经符号LoRA:为何以及何时调整权重 versus 重写提示

Kevin Wang, Neel P. Bhatt, Cong Liu, Junbo Li, Runjin Chen, Yihan Xi, Timothy Barclay, Alvaro Velasquez, Ufuk Topcu, Zhangyang Wang

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 神经符号LoRA结合数值和符号更新,提升语言模型微调的适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05178 2026-01-21 cs.LG cs.AI cs.SC 62%

Auditable Unit-Aware Thresholds in Symbolic Regression via Logistic-Gated Operators

可审计的单元感知阈值在通过逻辑门运算符进行的符号回归中

Ou Deng, Ruichen Cong, Jianting Xu, Shoji Nishimura, Atsushi Ogihara, Qun Jin

机构 * Faculty of Human Sciences, Waseda University(早稻田大学人类科学系) Graduate School of Human Sciences, Waseda University(早稻田大学人类科学研究院)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 LGO通过逻辑门运算符实现符号回归,将阈值提升为单元感知参数,提高医疗领域模型的可审计性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11560 2026-01-21 cs.IR cs.AI cs.LG 62%

DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research

DeepEvidence: 通过深度知识图谱研究赋能生物医学发现

Zifeng Wang, Zheng Chen, Ziwei Yang, Xuan Wang, Qiao Jin, Yifan Peng, Zhiyong Lu, Jimeng Sun

机构 * Keiji AI Institute of Scientific and Industrial Research, Osaka University(大阪大学科学工业研究所) Bioinformatics Center, Institute for Chemical Research, Kyoto University(京都大学化学研究所生物信息中心) Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家卫生研究院生物医学图书馆内部研究部) Department of Population Health Sciences, Weill Cornell Medicine(韦尔·科恩医学中心流行病学与健康科学系) School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DeepEvidence通过深度知识图谱研究框架,系统化地连接异构生物医学资源,提升科学发现的效率和证据综合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14091 2026-01-21 cs.RO cs.AI 57%

Zero-shot adaptable task planning for autonomous construction robots: a comparative study of lightweight single and multi-AI agent systems

零样本适应性任务规划用于自主建造机器人:轻量级单 agent 和多 agent 系统的比较研究

Hossein Naderi, Alireza Shojaei, Lifu Huang, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究通过比较轻量级单 agent 和多 agent 系统,探索了零样本适应性任务规划在自主建造机器人中的应用,展示了四 agent 团队在效率和成本上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14007 2026-01-21 cs.CL 57%

BACH-V: Bridging Abstract and Concrete Human-Values in Large Language Models

BACH-V: 联结抽象与具体的人类价值观在大语言模型中

Junyu Zhang, Yipeng Kang, Jiong Guo, Jiayu Zhan, Junqi Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 BACH-V研究通过探测和引导方法揭示大语言模型中抽象与具体价值观的联结机制,发现其能稳定锚定抽象价值观以影响具体决策。

Comments 34 pagess, 16 figures, 6 tables, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13995 2026-01-21 cs.CL 57%

From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning

从标签到树:为LLM指令微调中的可控数据选择构建细粒度知识

Zihan Niu, Wenping Hu, Junmin Chen, Xiyue Wang, Tong Xu, Ruiming Tang

机构 * University of Science and Technology of China(中国科学技术大学) Klear Team, Kuaishou Technology(快手科技Klear团队)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 TAGS通过构建细粒度知识树,实现LLM指令微调中可控数据选择的高效采样与知识对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03648 2026-01-21 cs.CL 57%

ELO: Efficient Layer-Specific Optimization for Continual Pretraining of Multilingual LLMs

ELO:面向多语言大语言模型持续预训练的高效分层优化

HanGyeol Yoo, ChangSu Choi, Minjun Kim, Seohyun Song, SeungWoo Song, Inho Won, Jongyoul Park, Cheoneum Park, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) LG CNS Korea Advanced Institute of Science and Technology(韩国科学技术院) Hanbat National University(汉 bat 国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 ELO通过分层优化提升多语言大模型持续预训练效率,实现6.46倍加速和6.2%性能提升。

Comments 12 pages, Accepted to EACL 2026 (Industrial Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12234 2026-01-21 cs.GR cs.AI cs.CV 57%

Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models

Proc3D: 基于大语言模型的3D形状过程生成与参数编辑

Fadlullah Raji, Stefano Petrangeli, Matheus Gadelha, Yu Shen, Uttaran Bhattacharya, Gang Wu

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Proc3D利用大语言模型实现3D形状的可编辑生成,通过参数化编辑提升设计效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏