arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2408.08821 2025-10-21 cs.IR cs.AI 57%

EasyRec: Simple yet Effective Language Models for Recommendation

Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments Published as an EMNLP'25 main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15647 2025-10-20 cs.IR cs.AI 57%

Enhance Large Language Models as Recommendation Systems with Collaborative Filtering

Zhisheng Yang, Xiaofei Xu, Ke Deng, Li Li

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00059 2025-10-20 cs.CV cs.LG 57%

Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models

Rui Hu, Delai Qiu, Shuyu Wei, Jiaming Zhang, Yining Wang, Shengping Liu, Jitao Sang

机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通数据挖掘重点实验室) Beijing Jiaotong University(北京交通大学) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司) Peng Cheng Lab(鹏城实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

Comments Accepted to ACL 2025 Findings

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17300 2025-10-20 cs.CR cs.LG 57%

Improving Intrusion Detection with Domain-Invariant Representation Learning in Latent Space

Padmaksha Roy, Tyler Cody, Himanshu Singhal, Kevin Choi, Ming Jin

机构 * Virginia Tech(弗吉尼亚理工大学) AI Center of Excellence, Deloitte(德勤人工智能卓越中心)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Journal ref European Conference of Machine Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14727 2025-10-17 cs.LG 57%

The Pursuit of Diversity: Multi-Objective Testing of Deep Reinforcement Learning Agents

Antony Bartlett, Cynthia Liem, Annibale Panichella

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments Pre-print - Accepted at Symposium on Search Based Software Engineering (SSBSE) 2025 co-located with ASE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14702 2025-10-17 cs.AI 57%

Cognitive-Aligned Spatio-Temporal Large Language Models For Next Point-of-Interest Prediction

Penglong Zhai, Jie Li, Fanyi Di, Yue Liu, Yifang Yuan, Jie Huang, Peng Wu, Sicong Wang, Mingyang Yin, Tingting Hu, Yao Xu, Xin Li

机构 * AMAP, Alibaba Group(阿里集团AMAP)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14387 2025-10-17 cs.AI 57%

Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?

Yijie Hu, Zihao Zhou, Kaizhu Huang, Xiaowei Huang, Qiufeng Wang

机构 * Xi’an-Jiaotong Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学) Duke Kunshan University(杜克昆山大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14223 2025-10-17 cs.IR cs.AI 57%

Large Scale Retrieval for the LinkedIn Feed using Causal Language Models

Sudarshan Srinivasa Ramanujam, Antonio Alonso, Saurabh Kataria, Siddharth Dangi, Akhilesh Gupta, Birjodh Singh Tiwana, Manas Somaiya, Luke Simon, David Byrne, Sojeong Ha, Sen Zhou, Andrei Akterskii, Zhanglong Liu, Samira Sriram, Crescent Xiong, Zhoutao Pei, Angela Shao, Alex Li, Annie Xiao, Caitlin Kolb, Thomas Kistler, Zach Moore, Hamed Firooz

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12498 2025-10-17 cs.CY cs.HC 57%

The Start Button Problem: a basis for human responsibility in artificial intelligence computation

Vincenzo Calderonio

专题命中 其他安全 :alignment(abstract);分类 cs.CY

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03479 2025-10-17 cs.CL 57%

Women, Infamous, and Exotic Beings: A Comparative Study of Honorific Usages in Wikipedia and LLMs for Bengali and Hindi

Sourabrata Mukherjee, Atharva Mehta, Sougata Saha, Akhil Arora, Monojit Choudhury

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments Accepted and published at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13255 2025-10-16 cs.CL cs.NE 57%

Hierarchical Frequency Tagging Probe (HFTP): A Unified Approach to Investigate Syntactic Structure Representations in Large Language Models and the Human Brain

Jingmin An, Yilong Song, Ruolin Yang, Nai Ding, Lingxi Lu, Yuxuan Wang, Wei Wang, Chu Zhuang, Qian Wang, Fang Fang

机构 * Peking University(北京大学) Zhejiang University(浙江大学) Beijing Language and Culture University(北京语言大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12966 2025-10-16 cs.CL 57%

3-Model Speculative Decoding

Sanghyun Byun, Mohanad Odema, Jung Ick Guack, Baisub Lee, Jacob Song, Woo Seong Chung

机构 * LG Electronics USA(LG电子美国公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments Accepted at NeurIPS SPIGM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12920 2025-10-16 astro-ph.IM cs.AI 57%

InferA: A Smart Assistant for Cosmological Ensemble Data

Justin Z. Tam, Pascal Grosset, Divya Banesh, Nesar Ramachandra, Terece L. Turton, James Ahrens

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04160 2025-10-16 cs.LG cs.MA 57%

OrbitZoo: Real Orbital Systems Challenges for Reinforcement Learning

Alexandre Oliveira, Katarina Dyreby, Francisco Caldas, Cláudia Soares

机构 * NOVA LINCS

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16804 2025-10-15 cs.MA cs.AI 57%

Multi-Agent Autonomous Driving Systems with Large Language Models: A Survey of Recent Advances

Yaozu Wu, Dongyuan Li, Yankai Chen, Renhe Jiang, Henry Peng Zou, Wei-Chieh Huang, Yangning Li, Liancheng Fang, Zhen Wang, Philip S. Yu

机构 * The University of Tokyo(东京大学) Cornell University(康奈尔大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04075 2025-10-15 cs.CL 57%

From Rational Answers to Emotional Resonance: The Role of Controllable Emotion Generation in Language Models

Yurui Dong, Luozhijie Jin, Yao Yang, Bingjie Lu, Jiaxi Yang, Zhi Liu

机构 * State Key Laboratory on Technologies for Chinese Medicine Pharmaceutical Process Control and Intelligent Manufacture(中药制药过程控制与智能制造技术国家重点实验室) Zhejiang Lab(浙江实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments 43 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11502 2025-10-14 cs.LG 57%

Learning to Make MISTAKEs: Modeling Incorrect Student Thinking And Key Errors

Alexis Ross, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10397 2025-10-14 cs.CL 57%

AssoMem: Scalable Memory QA with Multi-Signal Associative Retrieval

Kai Zhang, Xinyuan Zhang, Ejaz Ahmed, Hongda Jiang, Caleb Kumar, Kai Sun, Zhaojiang Lin, Sanat Sharma, Shereen Oraby, Aaron Colak, Ahmed Aly, Anuj Kumar, Xiaozhong Liu, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室) Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08075 2025-10-14 cs.AI 57%

Multi-Condition Conformal Selection

Qingyang Hao, Wenbo Liao, Bingyi Jing, Hongxin Wei

机构 * Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05444 2025-10-14 cs.CL 57%

PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairs

Sana Kang, Myeongseok Gwon, Su Young Kwon, Jaewook Lee, Andrew Lan, Bhiksha Raj, Rita Singh

机构 * KAIST(韩国科学技术院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12450 2025-10-14 cs.CL 57%

Language Surgery in Multilingual Large Language Models

Joanito Agili Lopo, Muhammad Ravi Shulthan Habibi, Tack Hwa Wong, Muhammad Ilham Ghozali, Fajri Koto, Genta Indra Winata, Peerat Limkonchotiwat, Alham Fikri Aji, Samuel Cahyawijaya

机构 * SEACrowd Kreasof AI Universitas Indonesia(印度尼西亚大学) MBZUAI Capital One AI Singapore(AI新加坡) Cohere

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09359 2025-10-13 cs.CL 57%

Understanding the Effects of Domain Finetuning on LLMs

Eshaan Tanwar, Deepak Nathani, William Yang Wang, Tanmoy Chakraborty

机构 * University of Copenhagen(哥本哈根大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Indian Institute of Technology, Delhi(德里印度理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01298 2025-10-13 q-bio.QM cs.CV cs.LG 57%

MorphGen: Controllable and Morphologically Plausible Generative Cell-Imaging

Berker Demirel, Marco Fumero, Theofanis Karaletsos, Francesco Locatello

专题命中 其他安全 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09030 2025-10-13 cs.CL 57%

Automated Refinement of Essay Scoring Rubrics for Language Models via Reflect-and-Revise

Keno Harada, Lui Yoshida, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08921 2025-10-13 cs.CY 57%

GBA-UBF : A Large-Scale and Fine-Grained Building Function Classification Dataset in the Greater Bay Area

Chunsong Chen, Yichen Hou, Huan Chen, Junlin Li, Rong Fu, Qiushen Lai, Yiping Chen, Ting Han

专题命中 其他安全 :alignment(abstract);分类 cs.CY

Comments 12 pages, 10 figures, The 4th ACM SIGSPATIAL International Workshop on Spatial Big Data and AI for Industrial Applications (GeoIndustry '25), November 3--6, 2025, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08665 2025-10-13 cs.SE cs.AI 57%

RA-Gen: A Controllable Code Generation Framework Using ReAct for Multi-Agent Task Execution

Aofan Liu, Haoxuan Li, Bin Wang, Ao Yang, Hui Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(超高清沉浸媒体技术省重点实验室) Shenzhen Graduate School, Peking University(深圳研究生院,北京大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08620 2025-10-13 cs.CL 57%

JAI-1: A Thai-Centric Large Language Model

Attapol T. Rutherford, Jullajak Karnjanaekarin, Narongkorn Panitsrisit, Pontakorn Trakuekul, Sumana Sumanakul, Natchanon Pollertlam

机构 * Jasmine Technology Solution, Thailand Department of Linguistics, Chulalongkorn University, Thailand(语言学系,朱拉隆功大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08885 2025-10-13 cs.RO cs.AI 57%

AirScape: An Aerial Generative World Model with Motion Controllability

Baining Zhao, Rongze Tang, Mingyuan Jia, Ziyou Wang, Fanghang Man, Xin Zhang, Yu Shang, Weichen Zhang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

机构 * Shenzhen International Graduate School, Tsinghua University Pengcheng Laboratory Shenzhen China School of Computer Science \& Technology, Beijing Institute of Technology Beijing China Department of Automation, Tsinghua University Beijing China Communication Engineering College, Northeastern University Qinhuangdao China Shenzhen International Graduate School, Tsinghua University Shenzhen China Department of Electronic Engineering, Tsinghua University Beijing China BNRist, Tsinghua University Beijing China Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University Beijing China Shenzhen International Graduate School, Tsinghua University Pengcheng Laboratory School of Computer Science \& Technology, Beijing Institute of Technology Department of Automation, Tsinghua University Communication Engineering College, Northeastern University Shenzhen International Graduate School, Tsinghua University Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08464 2025-10-10 cs.RO cs.LG 57%

Don't Run with Scissors: Pruning Breaks VLA Models but They Can Be Recovered

Jason Jabbour, Dong-Ki Kim, Max Smith, Jay Patrikar, Radhika Ghosal, Youhui Wang, Ali Agha, Vijay Janapa Reddi, Shayegan Omidshafiei

专题命中 其他安全 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08385 2025-10-10 cs.CV cs.AI cs.DB cs.IR 57%

Detecting Legend Items on Historical Maps Using GPT-4o with In-Context Learning

Sofia Kirsanova, Yao-Yi Chiang, Weiwei Duan

机构 * University of Minnesota(明尼苏达大学) Inferlink Corporation(Inferlink公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏