arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2511.04847 2026-02-24 cs.LG 57%

Test-Time Adaptation for LLM Agents via Environment Interaction

通过环境交互实现LLM代理的测试时适应

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

机构 * University of Waterloo(滑铁卢大学) Salesforce AI Research(Salesforce AI研究)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。

Comments Our code is available here: https://github.com/r2llab/GTTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11842 2026-02-24 cs.LG stat.ML 57%

Test-Time Training Provably Improves Transformers as In-context Learners

测试时训练可证明地提高变换器作为上下文学习者

Halil Alperen Gozeten, M. Emrullah Ildiz, Xuechen Zhang, Mahdi Soltanolkotabi, Marco Mondelli, Samet Oymak

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 测试时训练通过调整模型权重提升变换器在上下文学习中的性能,减少样本需求并提高推理效率。

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17815 2026-02-23 cs.CL 57%

Neural Synchrony Between Socially Interacting Language Models

社会交互语言模型间的神经同步

Zhining Zhang, Wentao Zhu, Chi Han, Yizhou Wang, Heng Ji

机构 * Peking University(北京大学) Eastern Institute of Technology(东部技术研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过分析社会交互语言模型间的神经同步,探讨其社会行为表现与神经同步的关联性,揭示了人类与语言模型社会互动的内在相似性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17680 2026-02-23 cs.LG 57%

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17536 2026-02-20 physics.acc-ph cs.AI 57%

Toward a Fully Autonomous, AI-Native Particle Accelerator

迈向完全自主的、原生AI粒子加速器

Chris Tennant

机构 * Jefferson Laboratory(杰弗逊实验室)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出通过AI共同设计构建完全自主的粒子加速器,旨在实现自主运行和最大化性能。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12414 2026-02-20 cs.CL 57%

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

propella-1:大规模LLM数据整理中的多属性文档标注

Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries

机构 * ellamind Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 propella-1通过多属性文档标注提升大规模LLM数据整理的效率和质量,揭示预训练数据集在质量、推理深度和内容组成上的显著差异。

Comments Release: https://hf.co/collections/ellamind/propella-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13582 2026-02-20 cs.LG cs.AR 57%

ArtNet: Hierarchical Clustering-Based Artificial Netlist Generator for ML and DTCO Application

ArtNet:基于层次聚类的人工网表生成器用于机器学习和设计-技术协同优化应用

Andrew B. Kahng. Seokhyeong Kang, Seonghyeon Park, Dooseok Yoon

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 ArtNet通过生成更接近目标参数的人工数据集,提升ML模型泛化能力并优化DTCO设计空间探索,实现PPA优化和设计能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11047 2026-02-19 cs.CL 57%

Embedding Inversion via Conditional Masked Diffusion Language Models

通过条件掩码扩散语言模型实现嵌入反向

Han Xiao

机构 * Jina AI by Elastic(Jina AI)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过条件掩码扩散语言模型实现嵌入反向,无需访问目标编码器,通过并行去噪技术高效恢复标记。

Comments 8 pages, 3 figures, 4 tables. Code and demo: https://github.com/jina-ai/embedding-inversion-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16101 2026-02-19 cs.LG 57%

Axle Sensor Fusion for Online Continual Wheel Fault Detection in Wayside Railway Monitoring

轴传感器融合用于在线持续轮故障检测在铁路旁侧监控

Afonso Lourenço, Francisca Osório, Diogo Risca, Goreti Marreiros

机构 * GECAD, ISEP, Polytechnic of Porto(GECAD、ISEP、波尔图理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于轴传感器融合和持续学习的铁路轮故障检测方法,通过变分自编码器和梯度提升分类器实现在线持续检测,适应动态操作条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00364 2026-02-19 cs.CV cs.LG 57%

LMSeg: Unleashing the Power of Large-Scale Models for Open-Vocabulary Semantic Segmentation

LMSeg:释放大规模模型在开放词汇语义分割中的潜力

Huadong Tang, Youpeng Zhao, Yan Huang, Min Xu, Jun Wang, Qiang Wu

机构 * Huadong Tang(华东唐) Youpeng Zhao(赵有鹏) Yan Huang(黄艳) Min Xu(徐敏) Jun Wang(王俊) Qiang Wu(吴强)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 LMSeg通过结合多个大规模模型提升开放词汇语义分割的性能,利用LLMs生成多样化视觉属性的提示并改进视觉特征提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15600 2026-02-18 cs.SI cs.AI econ.EM stat.AP 57%

The geometry of online conversations and the causal antecedents of conflictual discourse

在线对话的几何结构与冲突性言论的因果前因

Carlo Santagiustina, Caterina Cruciani

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文研究了在线对话中冲突性语言的因果因素,通过分析时间、对话结构等特征,揭示了回复语气和情感框架的趋同现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14428 2026-02-17 cs.CL 57%

LLM-Guided Knowledge Distillation for Temporal Knowledge Graph Reasoning

基于大语言模型的知识蒸馏的时序知识图谱推理

Wang Xing, Wei Song, Siyu Lin, Chen Wu, Man Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的知识蒸馏框架,用于提升时序知识图谱推理性能,通过引入大语言模型作为辅助指导者,实现更高效的模型压缩与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13954 2026-02-17 cs.SD cs.AI 57%

Eureka-Audio: Triggering Audio Intelligence in Compact Language Models

Eureka-Audio: 在紧凑语言模型中触发音频智能

Dan Zhang, Yishu Lei, Jing Hu, Shuwei He, Songhe Deng, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 Eureka-Audio通过紧凑架构和统一端到端设计,在低参数量下实现高性能音频理解,匹配甚至超越大模型表现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13758 2026-02-17 cs.CV cs.AI 57%

OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding

OmniScience: 一个大规模多模态数据集用于科学图像理解

Haoyi Tao, Chaozheng Huang, Nan Wang, Han Lyu, Linfeng Zhang, Guolin Ke, Xi Fang

机构 * DP Technology(DP技术)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 OmniScience是一个大规模多模态数据集,通过动态模型路由生成高信息密度的图像标题,提升多模态模型在科学图像理解上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12205 2026-02-16 cs.CV cs.AI 57%

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19093 2026-02-16 cs.LG 57%

Weight Decay may matter more than muP for Learning Rate Transfer in Practice

权重衰减可能比muP对学习率转移更重要

Atli Kosson, Jeremy Welborn, Yang Liu, Martin Jaggi, Xi Chen

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) EPFL(瑞士联邦理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究发现权重衰减在学习率转移中比muP更有效,挑战了传统观点并解释了muP对独立权重衰减的依赖。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19852 2026-02-16 cs.SD cs.AI 57%

Eliminating stability hallucinations in llm-based tts models via attention guidance

通过注意力引导消除基于大语言模型的TTS模型中的稳定性幻觉

ShiMing Wang, ZhiHao Du, Yang Xiang, TianYu Zhao, Han Zhao, Qian Chen, XianGang Li, HanJie Guo, ZhenHua Ling

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过改进注意力机制,减少基于大语言模型的TTS模型中的稳定性幻觉,提升语音合成的稳定性和连续性。

Comments The authors are withdrawing this preprint as it was submitted prematurely without the final approval of all collaborating institutions. We apologize for any inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12634 2026-02-16 cs.CY 57%

The Rise of AI Agent Communities: Large-Scale Analysis of Discourse and Interaction on Moltbook

AI代理社区的崛起:Moltbook上 discourse 和 interaction 的大规模分析

Lingyao Li, Renkai Ma, Chen Chen, Zhicong Lu, Yongfeng Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 研究分析了Moltbook上AI代理的讨论主题、发布行为及互动模式,揭示了代理自我意识的形成机制及社区协调的特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12500 2026-02-16 cs.SE cs.AI cs.CR 57%

Favia: Forensic Agent for Vulnerability-fix Identification and Analysis

Favia:漏洞修复识别与分析的取证代理

André Storhaug, Jiamou Sun, Jingyue Li

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Favia通过结合可扩展的候选排名与深入语义推理,有效识别漏洞修复,优于传统和LLM基方法。

Comments 44 pages, 12 figures, 5 tables, 3 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12419 2026-02-16 cs.AI 57%

Intent-Driven Smart Manufacturing Integrating Knowledge Graphs and Large Language Models

意图驱动的智能制造整合知识图谱和大语言模型

Takoua Jradi, John Violos, Dimitrios Spatharakis, Lydia Mavraidi, Ioannis Dimolitsas, Aris Leivadeas, Symeon Papavassiliou

机构 * 1Department of Software IT Engineering, École de technologie supérieure, Montreal, Canada 2School of Electrical \& Computer Engineering, National Technical University of Athens

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型和知识图谱的意图驱动智能制造框架,通过微调和语义映射提升制造系统的人机交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05096 2026-02-16 cs.CV cs.LG 57%

Visual concept ranking uncovers medical shortcuts used by large multimodal models

视觉概念排名揭示大型多模态模型使用的医学捷径

Joseph D. Janizek, Sonnet Xu, Junayd Lateef, Roxana Daneshjou

机构 * Stanford University(斯坦福大学) University of California Berkeley(加州大学伯克利分校)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出视觉概念排名方法,用于揭示大型多模态模型在医疗任务中表现的潜在视觉特征依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11881 2026-02-13 cs.AI 57%

From Atoms to Trees: Building a Structured Feature Forest with Hierarchical Sparse Autoencoders

从原子到树:构建具有层次稀疏自编码器的结构化特征森林

Yifan Luo, Yang Zhan, Jiedong Jiang, Tianyang Liu, Mingrui Wu, Zhennan Zhou, Bin Dong

机构 * School of Mathematical Science, Peking University, Beijing, China(北京大学数学科学学院) Beijing International Center for Mathematical Research(北京国际数学研究中心) the New Cornerstone Science Laboratory, Peking University, Beijing, China(北京大学新基石科学实验室) Center for Machine Learning Research, Peking University, Beijing, China(北京大学机器学习研究中心) School of Information and Electronics, Beijing Institute of Technology, Beijing, China(北京理工大学信息与电子学院) Institute for Theoretical Sciences, Westlake University, Hangzhou, China(西湖大学理论科学研究院) School of Science, Westlake University, Hangzhou, China(西湖大学理学院) School of Informatics, University of Edinburgh, Edinburgh, UK(爱丁堡大学信息学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出层次稀疏自编码器HSAE,通过结构约束和随机扰动机制,联合学习LLM中的层次化特征结构,实现语义有意义的多尺度概念分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11136 2026-02-13 cs.AI 57%

FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight

FormalJudge: 一种用于代理监管的神经符号范式

Jiayi Zhou, Yang Sheng, Hantao Lou, Yaodong Yang, Jie Fu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 FormalJudge通过神经符号框架结合形式验证,提升代理行为安全性和欺骗检测能力,实现数学保证而非概率评分。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11717 2026-02-13 cs.AI 57%

Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging

超越参数运算:用于分布感知模型融合的稀疏互补融合

Weihong Lin, Lin Sun, Qilong Shi, Aomufei Yuan, Yuxuan Tian, Zhengyang Wang, Guangxiang Zhao, Xiangzheng Zhang, Tong Yang

机构 * Beijing Qiyuan Technology Co., Ltd.(北京启元科技有限公司) Peking University(北京大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出SCF-RKL方法,通过稀疏、分布感知的更新控制功能干扰,提升模型融合的稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11643 2026-02-13 cs.RO cs.AI cs.CV 57%

ViTaS: Visual Tactile Soft Fusion Contrastive Learning for Visuomotor Learning

ViTaS: 用于视觉-运动学习的视觉触觉软融合对比学习

Yufeng Tian, Shuiqi Cheng, Tianming Wei, Tianxing Zhou, Yuanhang Zhang, Zixian Liu, Qianwei Han, Zhecheng Yuan, Huazhe Xu

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 ViTaS通过融合视觉和触觉信息,利用软融合对比学习提升视觉-运动学习的性能。

Comments Published to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09070 2026-02-13 cs.SD cs.AI eess.AS 57%

NarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Control

NarraScore: 通过分层情感控制弥合视觉叙事与音乐动态

Yufan Wen, Zhaocheng Liu, YeGuo Hua, Ziyi Guo, Lihua Zhang, Chun Yuan, Jian Wu

机构 * Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 NarraScore通过分层情感控制,实现视觉叙事与音乐动态的融合,以高密度压缩叙事逻辑,提升长视频配乐生成的连贯性与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02388 2026-02-13 cs.CL 57%

Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation

学习路由:一种基于规则的代理框架用于混合源检索增强生成

Haoyue Bai, Haoyu Wang, Shengyu Chen, Zhengzhang Chen, Lu-An Tang, Wei Cheng, Haifeng Chen, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) NEC Laboratories America(NEC美国实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于规则的路由框架,通过系统规则选择合适来源提升检索增强生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11024 2026-02-12 cs.CV cs.AI 57%

Chain-of-Look Spatial Reasoning for Dense Surgical Instrument Counting

密集手术器械计数的链式观察空间推理

Rishikesh Bhyri, Brian R Quaranto, Philip J Seger, Kaity Tung, Brendan Fox, Gene Yang, Steven D. Schwaitzberg, Junsong Yuan, Nan Xi, Peter C W Kim

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出Chain-of-Look框架,通过结构化视觉链提升密集手术器械计数的准确性,并引入邻近损失函数和SurgCount-HD数据集,实验证明其在复杂场景中的优越性能。

Comments Accepted to WACV 2026. This version includes additional authors who contributed during the rebuttal phase

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10597 2026-02-12 cs.CY 57%

Llama-Polya: Instruction Tuning for Large Language Model based on Polya's Problem-solving

Llama-Polya:基于波利亚问题解决框架的大型语言模型指令调优

Unggi Lee, Yeil Jeong, Chohui Lee, Gyuri Byun, Yunseo Lee, Minji Kang, Minji Jeon

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 Llama-Polya通过整合波利亚问题解决框架,提升大型语言模型在数学推理和教学对齐方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10454 2026-02-12 cs.CL 57%

LATA: A Tool for LLM-Assisted Translation Annotation

LATA:一个辅助翻译标注的工具

Baorong Huang, Ali Asiri

机构 * School of Foreign Languages, Huaihua University(怀化大学外语学院) Alith University College, Umm al-Qura University(乌姆·阿尔·库拉大学阿利思大学学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 LATA是一个利用大语言模型辅助的翻译标注工具,旨在提高标注效率的同时保持语言学精度,适用于结构差异大的语言对。

详情

展开后加载摘要…

URL PDF HTML 收藏