arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-06 至 2026-01-06 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 14 篇

2601.01546 2026-01-06 cs.AI 79%

Improving Behavioral Alignment in LLM Social Simulations via Context Formation and Navigation

通过情境形成与导航提升LLM社交模拟中的行为一致性

Letian Kong, Qianran, Jin, Renyu Zhang

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出通过情境形成与导航提升LLM在复杂决策环境中的行为一致性,验证了两阶段框架在不同任务中的有效性。

Comments 39 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05619 2026-01-06 cs.LG cs.SE 79%

Detecting Proxy Gaming in RL and LLM Alignment via Evaluator Stress Tests

通过评估者压力测试检测强化学习和大语言模型对齐中的代理游戏

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 通过评估者压力测试检测强化学习和大语言模型对齐中的代理游戏,提升安全性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01289 2026-01-06 cs.CR 78%

dataRLsec: Safety, Security, and Reliability With Robust Offline Reinforcement Learning for DPAs

dataRLsec: 通过鲁棒的离线强化学习实现DPAs的安全性、安全性和可靠性

Shriram KS Pandian, Naresh Kshetri

专题命中 其他安全 :safety(title,abstract)

AI总结 dataRLsec提出了一种鲁棒的离线强化学习方法,结合加权哈希验证和密度比加权行为克隆算法,以提升DPAs的安全性和可靠性。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24478 2026-01-06 cs.LG cs.AI stat.ME 76%

HOLOGRAPH: Active Causal Discovery via Sheaf-Theoretic Alignment of Large Language Model Priors

HOLOGRAPH:通过sheaf理论对大型语言模型先验进行对齐以实现主动因果发现

Hyunjun Kim

机构 * Korea Advanced Institute of Science \'Ecole Polytechnique F\'ed\'erale de Lausanne (EPFL), Lausanne, Switzerland

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG

AI总结 HOLOGRAPH通过sheaf理论对齐大型语言模型先验,实现主动因果发现,提供严谨的数学基础并实现竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03802 2026-01-06 cs.LG cs.AI 62%

Balancing Fidelity and Plasticity: Aligning Mixed-Precision Fine-Tuning with Linguistic Hierarchies

在保真度与可塑性之间寻求平衡:将混合精度微调与语言层次结构对齐

Changhai Zhou, Shiyang Zhang, Yuhua Zhou, Qian Qiao, Jun Gao, Shichao Weng, Weizhong Zhang, Cheng Jin

机构 * Fudan University(复旦大学) Yale University(耶鲁大学) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 QR-Adaptor通过联合优化量化位宽和LoRA秩,解决混合精度微调中保真度与可塑性的平衡问题,实现内存与性能的高效资源分配。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00994 2026-01-06 cs.AI cs.CY 62%

ElecTwit: A Framework for Studying Persuasion in Multi-Agent Social Systems

ElecTwit:多智能体社交系统中说服研究的框架

Michael Bao

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 ElecTwit通过模拟政治选举中的社交媒体互动,研究多智能体系统中说服现象的影响因素及不同模型架构对说服动态的作用。

Comments In proceedings of 2025 IEEE International Conference on Agentic AI (ICA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21576 2026-01-06 cs.CV cs.AI cs.LG 62%

Towards Long-window Anchoring in Vision-Language Model Distillation

迈向视觉-语言模型蒸馏中的长窗口锚定

Haoyi Zhou, Shuo Li, Tianyu Chen, Qi Song, Chonghan Gao, Jianxin Li

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LAid方法,通过改进注意力机制和RoPE响应调节,提升视觉-语言模型的长上下文理解能力,使蒸馏模型的有效上下文窗口长度增加3.2倍。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21170 2026-01-06 cs.CL 57%

Cosmos: Compressed and Smooth Latent Space for Text Diffusion Modeling

Cosmos: 用于文本扩散建模的压缩和平滑潜在空间

Viacheslav Meshchaninov, Egor Chimbulatov, Alexander Shabalin, Aleksandr Abramov, Dmitry Vetrov

机构 * HSE University(俄罗斯高等经济大学) Constructor University(建设大学) SaluteDevices

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Cosmos通过压缩和平滑的潜在空间提升文本生成效率,实现比传统方法更快的推理速度和相当的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09665 2026-01-06 cs.SI cs.CL 57%

Tales of the 2025 Los Angeles Fire: Hotwash for Public Health Concerns in Reddit via LLM-Enhanced Topic Modeling

2025年洛杉矶火灾故事:通过LLM增强的专题建模在Reddit上进行公共健康担忧的热洗

Sulong Zhou, Qunying Huang, Shaoheng Zhou, Yun Hang, Xinyue Ye, Aodong Mei, Kathryn Phung, Yuning Ye, Uma Govindswamy, Zehan Li

机构 * Department of Landscape Architecture and Urban Planning & Urban Artificial Intelligence Lab, Texas A&M University(景观建筑与城市规划系及城市人工智能实验室,德克萨斯农工大学) Geography, University of Wisconsin-Madison(地理系,威斯康星大学麦迪逊分校) Google(谷歌) Department of Environmental and Occupational Health Sciences, School of Public Health, University of Texas Health Science Center at Houston(环境与职业健康科学系,公共卫生学院,德克萨斯健康科学中心休斯顿分部) McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(麦克威廉斯生物医学信息学学院,德克萨斯健康科学中心休斯顿分部)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本研究通过LLM增强的专题建模分析2025年洛杉矶野火期间Reddit上的公众言论,识别出公共健康担忧和心理健康风险,构建了分层框架用于危机话语分析。

Comments Fix typos in Method Section. Add data/code availability

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24618 2026-01-06 cs.CL 57%

Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models

Youtu-LLM:解锁轻量级大语言模型的原生代理潜力

Junru Lu, Jiarui Qin, Lingfeng Qiao, Yinghui Li, Xinyi Dai, Bo Ke, Jianfeng He, Ruizhi Qiao, Di Yin, Xing Sun, Yunsheng Wu, Yinsong Liu, Shuangyin Liu, Mingkong Tang, Haodong Lin, Jiayi Kuang, Fanxu Meng, Xiaojuan Tang, Yunjia Xi, Junjie Huang, Haotong Yang, Zhenyi Shen, Yangning Li, Qianwen Zhang, Yifei Yu, Siyu An, Junnan Dong, Qiufeng Wang, Jie Wang, Keyu Chen, Wei Wen, Taian Guo, Zhifeng Shen, Daohai Yu, Jiahao Li, Ke Li, Zongyi Li, Xiaoyu Tan

机构 * Youtu-LLM Team(Youtu-LLM团队)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Youtu-LLM通过紧凑架构和长上下文支持,实现了轻量级大语言模型在代理任务中的高效推理与规划能力。

Comments 57 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08658 2026-01-06 cs.RO cs.AI 57%

Knowledge-data fusion dominated vehicle platoon dynamics modeling and analysis: A physics-encoded deep learning approach

基于知识-数据融合的车辆编队动力学建模与分析:一种物理编码深度学习方法

Hao Lyu, Yanyong Guo, Pan Liu, Shuo Feng, Weilin Ren, Quansheng Yue

机构 * School of Transportation, Southeast University, Nanjing, China, 211189(东南大学交通学院) Jiangsu Key Laboratory of Urban ITS, Nanjing, China, 210096(江苏省城市智能交通重点实验室) Jiangsu Collaborative Innovation Center of Modern Urban Traffic Technologies, Nanjing, China, 210096(江苏省现代城市交通技术协同创新中心) Department of Automation, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, Beijing, China, 100084(自动化系,北京信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出PeMTFLN模型,通过物理编码深度学习方法实现车辆编队动力学建模与分析,提升预测精度和稳定性。

Journal ref Information Fusion, Vol. 126, 103622, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00862 2026-01-06 cs.LG 57%

Universal Battery Degradation Forecasting Driven by Foundation Model Across Diverse Chemistries and Conditions

基于基础模型的通用电池退化预测:跨多样化学物质和条件

Joey Chan, Huan Wang, Haoyu Pan, Wei Wu, Zirong Wang, Zhen Chen, Ershun Pan, Min Xie, Lifeng Xi

机构 * Department of Industrial Engineering and Management, Shanghai Jiaotong University, Shanghai, China.(工业工程与管理系,上海交通大学,上海,中国) Department of Systems Engineering, The City University of Hong Kong, Hong Kong.(系统工程系,香港城市大学,香港)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出基于基础模型的通用电池退化预测框架,通过跨多样化学物质和条件的统一模型,实现稳定性能和高准确性。

Comments Due to space limitations, the open-source method for supporting materials is currently under discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01925 2026-01-06 cs.CV 50%

AR-MOT: Autoregressive Multi-object Tracking

AR-MOT:自回归多目标跟踪

Lianjie Jia, Yuhan Wu, Binghao Ran, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 其他安全 :alignment(abstract)

AI总结 AR-MOT通过自回归范式将多目标跟踪建模为序列生成任务,利用灵活的序列构建实现结构化输出,引入物体分词器和区域感知对齐模块,提升多模态和长期跟踪能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00497 2026-01-06 cs.SE 50%

STELLAR: A Search-Based Testing Framework for Large Language Model Applications

STELLAR: 一种基于搜索的大型语言模型应用测试框架

Lev Sorokin, Ivan Vasilev, Ken E. Friedl, Andrea Stocco

专题命中 其他安全 :safety(abstract)

AI总结 STELLAR通过进化优化方法,系统性地发现导致LLM应用故障的输入,提升测试效率和安全性。

Comments Accepted for publication at the 33th International Conference on Software Analysis, Evolution and Reengineering (SANER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏