arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2512.03445 2025-12-04 cs.CV cs.AI 57%

Multi-Aspect Knowledge-Enhanced Medical Vision-Language Pretraining with Multi-Agent Data Generation

多方面知识增强的医学视觉-语言预训练与多代理数据生成

Xieji Li, Siyuan Yan, Yingsheng Liu, H. Peter Soyer, Monika Janda, Victoria Mar, Zongyuan Ge

机构 * Department of Data Science and AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Victorian Melanoma Service, Alfred Health(维多利亚黑色素瘤服务,阿尔弗雷德健康) Frazer Institute, The University of Queensland, Dermatology Research Centre(弗雷泽研究所,昆士兰大学,皮肤科研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出一种多代理数据生成与多方面知识增强的医学视觉-语言预训练框架,通过提升数据质量和细粒度对齐,实现零样本性能的突破。

Comments 10 pages. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09571 2025-12-04 cs.RO cs.LG 57%

Are you a robot? Detecting Autonomous Vehicles from Behavior Analysis

你是机器人吗?通过行为分析检测自动驾驶汽车

Fabio Maresca, Filippo Grazioli, Antonio Albanese, Vincenzo Sciancalepore, Gianpiero Negri, Xavier Costa-Perez

机构 * NEC Laboratories Europe GmbH(NEC欧洲实验室) Flyhound Co.(Flyhound公司) i2CAT Foundation(i2CAT基金会) Amazon Global Robotics - EU Innovation Lab(亚马逊全球机器人-欧盟创新实验室)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种通过摄像头图像和状态信息自动识别自动驾驶车辆的框架,利用CARLA模拟器创建数据集并测试其识别准确率,达到80%-93%的识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22563 2025-12-03 cs.CL q-bio.NC 57%

Do Large Language Models Think Like the Brain? Sentence-Level Evidences from Layer-Wise Embeddings and fMRI

大语言模型是否像大脑思考?来自逐句嵌入和fMRI的层间证据

Yu Lei, Xingyang Ge, Yi Zhang, Yiming Yang, Bolei Ma

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过比较LLMs的层级嵌入与fMRI数据,揭示了大语言模型在句级层面与人类大脑的相似性,展示了LLMs在语言处理中的潜在应用价值。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15176 2025-12-03 q-bio.NC cs.AI 57%

Brain-aligning of semantic vectors improves neural decoding of visual stimuli

语义向量对齐改进视觉刺激的神经解码

Shirin Vafaei, Ryohei Fukuma, Takufumi Yanagisawa, Huixiang Yang, Satoru Oshino, Naoki Tani, Hui Ming Khoo, Hidenori Sugano, Yasushi Iimura, Hiroharu Suzuki, Madoka Nakajima, Kentaro Tamura, Haruhiko Kishima

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 语义向量对齐通过改进神经表示结构,提升视觉刺激的解码准确性。

Comments 88 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19405 2025-12-02 cs.LG 57%

Learning Robust Social Strategies with Large Language Models

利用大语言模型学习稳健的社会策略

Dereck Piche, Mohammed Muqeeth, Milad Aghajohari, Juan Duque, Michael Noukhovitch, Aaron Courville

机构 * Mila University of Montreal(蒙特利尔大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本研究通过改进的对手学习算法,使大语言模型在多智能体协作中更稳健,提升集体收益并防止被贪婪智能体利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00670 2025-12-02 cs.AI 57%

EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients

EDIT:基于训练梯度动态的早期扩散推理终止用于dLLMs

He-Yen Hsieh, Hong Wang, H. T. Kung

机构 * CISPA Harvard University(哈佛大学) Intel Corporation(英特尔公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 EDIT通过利用训练梯度动态,在保持准确性的同时减少dLLM推理步骤,提升效率。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00389 2025-12-02 cs.LG cs.GT stat.ML 57%

Solving Neural Min-Max Games: The Role of Architecture, Initialization & Dynamics

解决神经最小-最大游戏:架构、初始化与动态的作用

Deep Patel, Emmanouil-Vasileios Vlatakis-Gkaragkounis

机构 * Department of Computer Science University of Wisconsin-Madison(计算机科学系 威斯康星大学麦迪逊分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种理论框架,通过隐藏的凸性和过参数化解释神经最小-最大游戏中的全局收敛性,并首次为两层神经网络游戏提供了保证。

Comments Camera-ready for NeurIPS 2025 (including updated section on neural network initialization for experiments in Appendix C)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19217 2025-12-02 cs.CV cs.AI 57%

A Lightweight and Extensible Cell Segmentation and Classification Model for Whole Slide Images

一种轻量且可扩展的整张滑片图像细胞分割与分类模型

Nikita Shvetsov, Thomas K. Kilvaer, Masoud Tafavvoghi, Anders Sildnes, Kajsa Møllersen, Lill-Tove Rasmussen Busund, Lars Ailo Bongo

机构 * Department of Computer Science, UiT The Arctic University of Norway(计算机科学系,UiT北极大学) Department of Oncology, University Hospital of North Norway(肿瘤学系,北挪威大学医院) Department of Clinical Medicine, UiT The Arctic University of Norway(临床医学系,UiT北极大学) Department of Community Medicine, UiT The Arctic University of Norway(社区医学系,UiT北极大学) Department of Medical Biology, UiT The Arctic University of Norway(医学生物学系,UiT北极大学) Department of Clinical Pathology, University Hospital of North Norway(临床病理学系,北挪威大学医院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种轻量且可扩展的细胞分割与分类模型,通过改进数据标注、利用H-Optimus基础模型和知识蒸馏,提升分割和分类性能,同时降低计算复杂度。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00267 2025-12-02 cs.AI 57%

Trification: A Comprehensive Tree-based Strategy Planner and Structural Verification for Fact-Checking

Trification: 一种基于树的综合策略规划与结构验证事实核查系统

Anab Maulana Barik, Shou Ziyi, Yang Kaiwen, Yang Qi, Shen Xin

机构 * Huawei Celia Team(华为Celia团队)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 Trification提出了一种基于树的综合策略规划与结构验证的事实核查框架,通过生成依赖图并动态调整验证策略,提高了事实核查的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00059 2025-12-02 cs.AR cs.LG 57%

SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators

SafeCiM: 探究混合浮点计算内存深度学习加速器的鲁棒性

Swastik Bhattacharya, Sanjay Das, Anand Menon, Shamik Kundu, Arnab Raha, Kanad Basu

机构 * Department of Electrical and Computer Engineering, University of Texas at Dallas(得克萨斯大学达拉斯分校电气与计算机工程系) Advanced Architecture Research Group at Intel Corporation(英特尔公司先进架构研究组) Department of Electrical, Computer and Systems Engineering, Rensselaer Polytechnic Institute(拉特格斯理工学院电气、计算机与系统工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 SafeCiM通过引入位翻转故障分析,提升了混合浮点计算内存加速器在硬件故障下的鲁棒性,显著降低了LLM推理准确性下降的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22903 2025-12-01 cs.CV cs.AI 57%

Leveraging Textual Compositional Reasoning for Robust Change Captioning

利用文本组合推理实现鲁棒的变更描述

Kyu Ri Park, Jiyoung Park, Seong Tae Kim, Hong Joo Lee, Jung Uk Kim

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 CORTEX通过整合文本线索和组合推理,提升图像变化描述的鲁棒性与准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22739 2025-12-01 cs.CV cs.AI 57%

All Centers Are at most a Few Tokens Apart: Knowledge Distillation with Domain Invariant Prompt Tuning

所有中心距离最多几个token:基于领域不变提示微调的知识蒸馏

Amir Mohammad Ezzati, Alireza Malekhosseini, Armin Khosravi, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology, Tehran, Iran(计算机工程系,谢赫拉兹大学,德黑兰,伊朗)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出领域不变提示微调(DIPT)方法,通过学习领域不变提示提升知识蒸馏效果,从而增强病理学领域模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22594 2025-12-01 cs.CV cs.AI 57%

HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models

HarmoCLIP:在对比视觉语言模型中协调全局和区域表示

Haoxi Zeng, Haoxuan Li, Yi Bin, Pengpeng Zeng, Xing Xu, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 HarmoCLIP通过引入细粒度语义监督和区域-语言对齐策略,协调CLIP中全局与区域表示,提升检索和边界框分类性能,实现平衡高效的全局-局部权衡解决方案。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21746 2025-12-01 cs.CL 57%

DELTA: Language Diffusion-based EEG-to-Text Architecture

DELTA: 基于语言扩散的EEG到文本架构

Mingyu Jeon, Hyobin Kim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 DELTA通过结合残差向量量化和语言扩散模型,提升了EEG到文本的语义对齐和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00417 2025-12-01 cs.SE cs.AI cs.HC 57%

Human-AI Programming Role Optimization: Developing a Personality-Driven Self-Determination Framework

人类-人工智能编程角色优化:开发一种以个性驱动的自我决定框架

Marcel Valovy

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出基于人格特质的自我决定理论框架,通过设计科学方法优化人类与AI协作角色,提升团队动态和动机水平。

Comments PhD Dissertation, Prague University of Economics and Business, 2025. 323 pages. ACM CCS 2012: Human-computer interaction, Collaborative interaction, Human-AI collaborative systems, Pair programming, AI-assisted software engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20965 2025-11-27 cs.CV cs.CL 57%

TrafficLens: Multi-Camera Traffic Video Analysis Using LLMs

TrafficLens: 多摄像头交通视频分析使用LLMs

Md Adnan Arefeen, Biplob Debnath, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美国实验室) University of Missouri–Kansas City (UMKC)(密苏里大学-堪萨斯城分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 TrafficLens通过利用多摄像头重叠区域和对象相似性检测,高效地将视频转换为文本,减少处理时间并提升交通视频分析效率。

Comments 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20344 2025-11-26 cs.CL 57%

The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models

类比的奇特案例:在大型语言模型中探讨类比推理

Taewhoo Lee, Minju Song, Chanwoong Yoon, Jungwoo Park, Jaewoo Kang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究探讨了大型语言模型在类比推理中的能力,发现其在编码和应用高层关系概念方面表现出有限但新兴的能力,揭示了与人类认知的相似性和差距。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19471 2025-11-26 eess.IV cs.AI cs.CV 57%

Not Quite Anything: Overcoming SAMs Limitations for 3D Medical Imaging

并非一切:克服SAMs在3D医学影像中的局限性

Keith Moore

机构 * Deptartment of Biomedical Data Science Stanford University(生物医学数据科学系 斯坦福大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种无需微调基础模型的组合性替代方案,通过将基础模型输出作为额外输入通道来提高3D医学影像分割的准确性与鲁棒性。

Comments Preprint; Paper accepted at AIAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03469 2025-11-25 cs.AI cs.LO 57%

Bridging LLM Planning Agents and Formal Methods: A Case Study in Plan Verification

连接大语言模型规划代理与形式方法:计划验证的案例研究

Keshav Ramani, Vali Tawosi, Salwa Alamir, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种利用大语言模型将自然语言计划转换为形式化逻辑并进行验证的框架,展示了GPT-5在计划验证中的高准确率及形式化表示的生成能力。

Comments Accepted to AgenticSE Workshop at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04645 2025-11-25 cs.IR cs.AI 57%

Pathway to Relevance: How Cross-Encoders Implement a Semantic Variant of BM25

相关性路径:交叉编码器如何实现语义变体的BM25

Meng Lu, Catherine Chen, Carsten Eickhoff

机构 * Brown University(布朗大学) University of Tübingen(图宾根大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文通过分析交叉编码器的机制,揭示其如何通过结合传统相关性信号实现语义变体的BM25排序功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18403 2025-11-25 cs.CY 57%

UnWEIRDing LLM Entity Recommendations

去WEIRD化LLM实体推荐

Aayush Kumar, Sanket Mhatre

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本文研究了LLM在现实世界实体推荐中的文化偏见,通过WEIRD框架评估并应用多元提示策略以减轻偏见,发现不同模型的偏见减轻效果不一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18306 2025-11-25 cs.CL 57%

Table Comprehension in Building Codes using Vision Language Models and Domain-Specific Fine-Tuning

利用视觉语言模型和领域特定微调进行建筑规范中的表格理解

Mohammad Aqib, Mohd Hamza, Ying Hei Chui, Qipei Mei

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文研究了利用视觉语言模型和领域特定微调提取建筑规范中表格信息的方法,发现直接输入方法在准确性上优于间接输入方法,且微调后模型性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06859 2025-11-25 cs.AI cs.CV 57%

MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Prediction

MeteorPred:一种用于恶劣天气事件预测的气象多模态大模型和数据集

Shuo Tang, Jian Xu, Jiadong Zhang, Yi Chen, Qizhao Jin, Lingdong Shen, Chenglin Liu, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing(中关村学院) China Meteorological Administration(中国气象局)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MeteorPred提出一种多模态大模型和数据集,用于提升恶劣天气事件预测的准确性和自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17413 2025-11-25 cs.CL 57%

Conversations: Love Them, Hate Them, Steer Them

对话:喜欢它们,讨厌它们,引导它们

Niranjan Chebrolu, Gerard Christopher Yeo, Kokil Jaidka

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文通过激活工程引导LLaMA 3.1-8B增强情感表达,提升对话AI的共情能力。

Comments We have created a new arXiv submission with a more up to date version of this paper at arXiv:2511.12832

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13093 2025-11-25 cs.CV cs.AI 57%

Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension

Video-RAG: 基于视觉对齐的检索增强长视频理解

Yongdong Luo, Xiawu Zheng, Guilin Li, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Fei Chao, Jiebo Luo, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Nanjing University(南京大学) University of Rochester(罗切斯特大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Video-RAG通过视觉对齐的辅助文本提升长视频理解性能,无需训练且兼容性强,显著优于专有模型。

Comments Accepted at NeurIPS 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19588 2025-11-24 physics.chem-ph cs.LG 57%

Discovery of Sustainable Refrigerants through Physics-Informed RL Fine-Tuning of Sequence Models

通过结合物理信息的强化学习微调序列模型发现可持续制冷剂

Adrien Goldszal, Diego Calanzone, Vincent Taboga, Pierre-Luc Bacon

机构 * École Polytechnique(巴黎政治学院) Mila Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 Refgen通过结合物理信息的强化学习微调序列模型,有效发现新型可持续制冷剂。

Comments Accepted to 1st SIMBIOCHEM Workshop at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16588 2025-11-21 cs.AI cs.LO 57%

Formal Abductive Latent Explanations for Prototype-Based Networks

基于原型网络的正式归纳性隐式解释

Jules Soria, Zakaria Chihani, Julien Girard-Satabin, Alban Grastien, Romain Xu-Darme, Daniela Cancila

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于原型网络的正式归纳性隐式解释方法,通过形式化方法提升模型可解释性,适用于图像分类任务。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16494 2025-11-21 cs.CV cs.AI 57%

Physics-Informed Machine Learning for Efficient Sim-to-Real Data Augmentation in Micro-Object Pose Estimation

基于物理的机器学习用于微物体位姿估计中的高效仿真到现实数据增强

Zongcai Tan, Lan Wei, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、帝国理工学院伦敦分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于物理的深度生成学习框架,通过整合波动光学和深度对齐,高效生成高保真显微镜图像,提升微机器人位姿估计的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04250 2025-11-21 stat.ME cs.AI cs.ET cs.IR stat.AP 57%

How many patients could we save with LLM priors?

使用 LLM 先验知识能挽救多少患者?

Shota Arai, David Selby, Andrew Vargo, Sebastian Vollmer

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 利用LLM生成的先验知识优化多中心临床试验中的不良事件建模,提高预测性能并减少患者数量需求。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17747 2025-11-21 cs.CL 57%

Discriminating Form and Meaning in Multilingual Models with Minimal-Pair ABX Tasks

通过最小对ABX任务区分多语言模型中的形式与意义

Maureen de Seyssel, Jie Chi, Skyler Seto, Maartje ter Hoeve, Masha Fedzechkina, Natalie Schluter

机构 * Apple(苹果公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 通过最小对ABX任务研究多语言模型中形式与意义的区分能力,揭示了语言识别和语义识别在训练过程中的变化规律。

Comments Comments: Published in EMNLP 2025. https://aclanthology.org/2025.emnlp-main.1210.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏