arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-27 至 2025-11-27 共收录 50 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2511.21624 2025-11-27 cs.SI cs.CL 57%

TAGFN: A Text-Attributed Graph Dataset for Fake News Detection in the Age of LLMs

TAGFN:一种用于LLMs时代虚假新闻检测的文本属性图数据集

Kay Liu, Yuwei Han, Haoyan Xu, Henry Peng Zou, Yue Zhao, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Southern California(南加州大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 TAGFN是一种用于虚假新闻检测的文本属性图数据集,旨在评估传统和基于LLM的图异常检测方法,并促进LLMs的虚假信息检测能力发展。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21420 2025-11-27 cs.CV cs.AI 57%

SAM Guided Semantic and Motion Changed Region Mining for Remote Sensing Change Captioning

基于SAM的语义与运动变化区域挖掘用于遥感变化描述

Futian Wang, Mengqi Wang, Xiao Wang, Haowen Wang, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于SAM模型的遥感变化描述方法,通过融合语义和运动变化区域信息,提升变化描述的准确性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20976 2025-11-27 physics.soc-ph cs.AI physics.ao-ph physics.atm-clus physics.chem-ph physics.comp-ph 57%

AI4X Roadmap: Artificial Intelligence for the advancement of scientific pursuit and its future directions

AI4X路线图:人工智能用于科学探索的进步及其未来方向

Stephen G. Dale, Nikita Kazeev, Alastair J. A. Price, Victor Posligua, Stephan Roche, O. Anatole von Lilienfeld, Konstantin S. Novoselov, Xavier Bresson, Gianmarco Mengaldo, Xudong Chen, Terence J. O'Kane, Emily R. Lines, Matthew J. Allen, Amandine E. Debus, Clayton Miller, Jiayu Zhou, Hiroko H. Dodge, David Rousseau, Andrey Ustyuzhanin, Ziyun Yan, Mario Lanza, Fabio Sciarrino, Ryo Yoshida, Zhidong Leong, Teck Leong Tan, Qianxiao Li, Adil Kabylda, Igor Poltavsky, Alexandre Tkatchenko, Sherif Abdulkader Tawfik, Prathami Divakar Kamath, Theo Jaffrelot Inizan, Kristin A. Persson, Bryant Y. Li, Vir Karan, Chenru Duan, Haojun Jia, Qiyuan Zhao, Hiroyuki Hayashi, Atsuto Seko, Isao Tanaka, Omar M. Yaghi, Tim Gould, Bun Chan, Stefan Vuckovic, Tianbo Li, Min Lin, Zehcen Tang, Yang Li, Yong Xu, Amrita Joshi, Xiaonan Wang, Leonard W. T. Ng, Sergei V. Kalinin, Mahshid Ahmadi, Jiyizhe Zhang, Shuyuan Zhang, Alexei Lapkin, Ming Xiao, Zhe Wu, Kedar Hippalgaonkar, Limsoon Wong, Lorenzo Bastonero, Nicola Marzari, Dorye Luis Esteras Cordoba, Andrei Tomut, Alba Quinones Andrade, Jose-Hugo Garcia

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出AI4X路线图,探讨人工智能在科学探索中的应用,强调数据多样性、可转移模型和生成系统的重要性,旨在推动更透明和高效的AI科学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20662 2025-11-27 cs.CL 57%

Democratizing LLM Efficiency: From Hyperscale Optimizations to Universal Deployability

让大语言模型效率普及:从超大规模优化到通用部署

Hen-Hsen Huang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过改进LLM的效率方法,使其在有限资源和专业知识下仍能有效运作,以实现更广泛的部署和公平性。

Comments 8 pages, accepted as a Blue Sky Talk in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20382 2025-11-27 cs.LG q-bio.GN 57%

MoRE: Batch-Robust Multi-Omics Representations from Frozen Pre-trained Transformers

MoRE:从冻结预训练转换器中获得批量鲁棒多组学表示

Audrey Pei-Hsuan Chen

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 MoRE通过参数高效微调策略,实现多组学数据的鲁棒表示学习,减少可训练参数并提升跨细胞类型和平台的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15974 2025-11-27 cs.AI 57%

KRAL: Knowledge and Reasoning Augmented Learning for LLM-assisted Clinical Antimicrobial Therapy

KRAL: 用于LLM辅助临床抗菌治疗的知识与推理增强学习

Zhe Li, Yehan Qiu, Yujie Chen, Xiang Zhou

机构 * Information Center, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital(信息中心、复杂严重罕见疾病国家重点实验室、北京友谊医院) Department of Critical Care Medicine, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(重症医学科、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院) Medical Intensive Care Unit, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(医疗重症病房、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 KRAL通过知识与推理增强学习提升LLM在临床抗菌治疗中的诊断能力,以低成本高效方式优化医疗决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21106 2025-11-27 cs.CV 50%

EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens

EM-KD: 通过不平衡视觉标记的知识蒸馏提升高效多模态大语言模型

Ze Feng, Sen Yang, Boqiang Duan, Wankou Yang, Jingdong Wang

机构 * Baidu VIS(百度视觉)

专题命中 安全评测 :alignment(abstract)

AI总结 EM-KD通过改进的知识蒸馏方法,有效提升高效多模态大语言模型的视觉理解和效率。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20914 2025-11-27 eess.SY cs.SY 50%

Distributionally Robust Cascading Risk in Multi-Agent Rendezvous: Extended Analysis of Parameter-Induced Ambiguity

多智能体会合中的分布鲁棒级联风险:参数诱导模糊性的扩展分析

Vivek Pandey, Nader Motee

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种分析多智能体会合中分布鲁棒级联风险的理论框架,通过引入条件分布鲁棒函数和闭合形式风险表达式,揭示了参数不确定性对集体安全的影响,并通过模拟验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2511.21249 2025-11-27 physics.optics 78%

Monitoring and Regulation of Micro-Displacement Deviation in Few-Mode Beam Alignment through Mode Decomposition

通过模式分解实现少模光纤对准中的微位移偏差监测与调节

Lin Xu, Li Pei, Jianshuai Wang, Zhouyi Hu, Tigang Ning

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本研究提出通过模式分解与机器学习算法实现少模光纤三维位移精确测量与调节,提升光路对准精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21009 2025-11-27 cs.LG 74%

ChatGpt Content detection: A new approach using xlm-roberta alignment

ChatGpt 内容检测:一种使用XLM-RoBERTa对齐的新方法

Md Tasnin Tanvir, Dr Santanu Kumar Dash, Ishan Shahnan, Nafis Fuad, Tanvir Rahman, Abdullah Al Faisal, Asadullah Al Mamun

专题命中 AI治理与伦理 :alignment(title);分类 cs.LG

AI总结 本文提出利用XLM-RoBERTa模型检测AI生成文本,通过特征提取和模型微调提高区分人类与AI文本的准确性,并探讨其在学术诚信和AI伦理中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01812 2025-11-27 cs.CY cs.AI cs.CL 67%

From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice

从文本到多模态:探索大型语言模型在医疗实践中的演变与影响

Qian Niu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Junyu Liu, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Benji Peng, Xinyuan Song, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Indiana University(印第安纳大学) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(Purdue 大学) Emory University, Atlanta, GA, USA(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20680 2025-11-27 cs.CL cs.AI 62%

Cognitive bias in LLM reasoning compromises interpretation of clinical oncology notes

大语言模型的认知偏差影响临床肿瘤学笔记的解读

Matthew W. Kenaston, Umair Ayub, Mihir Parmar, Muhammad Umair Anjum, Syed Arsalan Ahmed Naqvi, Priya Kumar, Samarth Rawal, Aadel A. Chaudhuri, Yousef Zakharia, Elizabeth I. Heath, Tanios S. Bekaii-Saab, Cui Tao, Eliezer M. Van Allen, Ben Zhou, YooJung Choi, Chitta Baral, Irbaz Bin Riaz

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了大语言模型在肿瘤学笔记解读中因推理缺陷导致的临床安全隐患,并提出了一种可推广的推理错误分类框架。

Comments 24 pages, 6 figures, 1 supplementary figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20783 2025-11-27 cs.CL 57%

On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey

在预训练语言模型中通用文本嵌入的作用:综述

Meishan Zhang, Xin Zhang, Xinping Zhao, Shouzheng Huang, Baotian Hu, Min Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文综述了预训练语言模型在通用文本嵌入中的作用,探讨了其架构、核心方法及未来研究方向。

Comments 45 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 7 篇

2511.20931 2025-11-27 cs.CV cs.AI cs.LG 81%

Open Vocabulary Compositional Explanations for Neuron Alignment

开放词汇组合解释用于神经元对齐

Biagio La Rosa, Leilani H. Gilpin

机构 * Department of Computer Science and Engineering University of California, Santa Cruz(计算机科学与工程系加州大学圣克ruz分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种开放词汇组合解释框架,通过语义分割生成掩码来实现神经元对齐,提升解释的灵活性和适用性。

Comments 47 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20669 2025-11-27 cs.CL cs.AI 62%

Structured Definitions and Segmentations for Legal Reasoning in LLMs: A Study on Indian Legal Data

结构化定义与分割在大语言模型法律推理中的应用:对印度法律数据的研究

Mann Khatri, Mirza Yusuf, Rajiv Ratn Shah, Ponnurangam Kumaraguru

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔学院信息科技研究所) International Institute of Information Technology Hyderabad(国际信息科技研究所(海得拉巴))

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过结构化定义与分割方法提升大语言模型在法律推理中的性能,实验显示在印度法律数据集上模型性能提升达1.5%-4.36%。

Comments Accepted at BDA 2025 as short paper; This paper is long version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19858 2025-11-27 cs.CL cs.AI 62%

A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Error Detection and Correction

基于RAG动态提示的大型语言模型系统分析:用于医疗错误检测与纠正

Farzad Ahmed, Joniel Augustine Jerome, Meliha Yetisgen, Özlem Uzuner

机构 * George Mason University(乔治·马歇尔大学) University of Washington(华盛顿大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于RAG动态提示的医疗错误检测与纠正方法,通过对比不同提示策略,发现RDP在准确率、召回率和纠错可靠性方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20965 2025-11-27 cs.CV cs.CL 57%

TrafficLens: Multi-Camera Traffic Video Analysis Using LLMs

TrafficLens: 多摄像头交通视频分析使用LLMs

Md Adnan Arefeen, Biplob Debnath, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美国实验室) University of Missouri–Kansas City (UMKC)(密苏里大学-堪萨斯城分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 TrafficLens通过利用多摄像头重叠区域和对象相似性检测,高效地将视频转换为文本,减少处理时间并提升交通视频分析效率。

Comments 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV 50%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21045 2025-11-27 cs.SD 50%

CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation

CartoonSing: 统一人类与非人类声音在歌唱生成中的表现

Jionghao Han, Jiatong Shi, Zhuoyan Tao, Yuxun Tang, Yiwen Zhao, Gus Xia, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Renmin University of China(中国人民大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他安全 :alignment(abstract)

AI总结 CartoonSing通过统一框架生成非人类声音,解决非人类声音数据稀缺和音色差异问题,拓展了歌唱生成的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21037 2025-11-27 cs.HC 50%

LOOM: Personalized Learning Informed by Daily LLM Conversations Toward Long-Term Mastery via a Dynamic Learner Memory Graph

LOOM:通过动态学习者记忆图实现每日LLM对话指导的个性化学习以实现长期掌握

Justin Cui, Kevin Pu, Tovi Grossman

专题命中 其他安全 :alignment(abstract)

AI总结 LOOM通过动态学习者记忆图分析每日LLM对话,生成个性化学习材料以实现长期掌握,兼顾连续性和主动性,提升学习者持续进步与即时相关性的平衡。

Comments Accepted to the PerFM Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏