arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2601.10310 2026-01-16 cs.CL 57%

Multilinguality as Sense Adaptation

多语言性作为意义适应

Jan Christian Blaise Cruz, David Ifeoluwa Adelani, Alham Fikri Aji

机构 * MBZUAI McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能席位) SEACrowd

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 SENSIA通过意义层面的对齐和上下文表示,实现多语言转换,优于现有方法并以更少数据获得竞争力结果。

Comments Code available at https://github.com/jcblaisecruz02/sensia

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10025 2026-01-16 cs.AI 57%

Structured Personality Control and Adaptation for LLM Agents

结构化人格控制与适应用于大语言模型代理

Jinpeng Wang, Xinyu Jia, Wei Wei Heng, Yuquan Li, Binbin Shi, Qianlei Chen, Guannan Chen, Junxia Zhang, Yuyu Yin

机构 * Key Laboratory of Complex Systems Modeling and Simulation of Ministry of Education(教育部复杂系统建模与仿真重点实验室) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于荣格心理学类型模型的结构化人格控制框架,通过协调、强化补偿和反思机制实现LLM人格的细腻表达与动态适应,提升人机交互中的自然代理设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09971 2026-01-16 cs.LG 57%

An Exploratory Study to Repurpose LLMs to a Unified Architecture for Time Series Classification

一项探索性研究:将大语言模型重新利用到时间序列分类的统一架构中

Hansen He, Shuheng Li

机构 * Canyon Crest Academy(山崖顶学术院) UC San Diego(圣迭戈大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本研究探索了将大语言模型与时间序列编码器结合的混合架构,发现Inception模型在提升性能方面表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09755 2026-01-16 cs.NE cs.AI cs.RO 57%

Heterogeneous computing platform for real-time robotics

异构计算平台用于实时机器人

Jakub Fil, Yulia Sandamirskaya, Hector Gonzalez, Loïc Azzalin, Stefan Glüge, Lukas Friedenstab, Friedrich Wolf, Tim Rosmeisl, Matthias Lohrmann, Mahmoud Akl, Khaleel Khan, Leonie Wolf, Kristin Richter, Holm Puder, Mazhar Ali Bari, Xuan Choo, Noha Alharthi, Michael Hopkins, Mansoor Hanif Christian Mayr, Jens Struckmeier, Steve Furber

机构 * WAIYS GmbH(WAIYS公司) Zurich University of Applied Sciences(苏黎世应用科学大学) SpiNNcloud Systems GmbH(SpiNNcloud系统公司) TU Dresden(德累斯顿技术大学) Applied Brain Research(应用脑科研) NEOM The University of Manchester(曼彻斯特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出一种异构计算平台,结合神经形态计算硬件与AI计算集群,用于实时机器人感知与交互任务,提升机器人自主性和智能水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06399 2026-01-15 eess.SY cs.AI cs.SY 57%

An AI-Driven Thermal-Fluid Testbed for Advanced Small Modular Reactors: Integration of Digital Twin and Large Language Models

面向先进小型模块化反应堆的AI驱动热-流体测试平台:数字孪生与大语言模型的集成

Doyeong Lim, Yang Liu, Zavier Ndum Ndum, Christian Young, Yassin Hassan

机构 * organization= Department of Nuclear Engineering, Texas A\&M University , city= College Station , postcode= 77843 , state= TX , country= USA

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出一个结合数字孪生与大语言模型的AI驱动热-流体测试平台,用于加速小型模块化反应堆的创新与部署。

Journal ref AI Thermal Fluids, 100023 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08401 2026-01-14 cs.CV cs.AI 57%

An Explainable Two Stage Deep Learning Framework for Pericoronitis Assessment in Panoramic Radiographs Using YOLOv8 and ResNet-50

可解释的两阶段深度学习框架用于全景X光片中牙周炎评估:使用YOLOv8和ResNet-50

Ajo Babu George, Pranav S, Kunal Agarwal

机构 * DiceMed College of Engineering Trivandrum(工程学院) S.C.B Dental College and Hospital(S.C.B牙科学院和医院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种结合YOLOv8和ResNet-50的两阶段深度学习框架,用于可解释性地评估全景X光片中的牙周炎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08017 2026-01-14 cs.CV cs.AI 57%

Representations of Text and Images Align From Layer One

文本和图像的表示从第一层对齐

Evžen Wybitul, Javier Rando, Florian Tramèr, Stanislav Fort

机构 * D-INFK, ETH Zurich, Switzerland(苏黎世联邦理工学院信息与知识系统研究所) Aisle Research(Aisle研究)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究通过合成方法证明,视觉-语言模型中图像和文本表示在第一层即可实现对齐,为模型可解释性提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07939 2026-01-14 cs.SE cs.AI 57%

SECite: Analyzing and Summarizing Citations in Software Engineering Literature

SECite: 分析和总结软件工程文献中的引用

Shireesh Reddy Pyreddy, Khaja Valli Pathan, Hasan Masum, Tarannum Shaila Zaman

机构 * Dept. of Computer Science SUNY Polytechnic Institute(计算机科学系圣尼古拉学院) Dept. of Information Systems University of Maryland Baltimore County(信息系统系马里兰大学巴尔的摩县)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SECite通过分析文献引用中的情感倾向,结合生成式AI生成摘要,提供了一种评估学术贡献的综合框架。

Comments Accepted at IEEE CCWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 57%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07033 2026-01-13 cs.CL 57%

Codified Foreshadowing-Payoff Text Generation

编码的预兆-回报文本生成

Longfei Yun, Kun Zhou, Yupeng Hou, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出CFPG框架,通过编码预兆-回报机制,提升LLM的叙事生成能力,实现情节逻辑的准确兑现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06527 2026-01-13 cs.LG stat.ML 57%

Wide Neural Networks as a Baseline for the Computational No-Coincidence Conjecture

宽神经网络作为计算无巧合猜想的基线

John Dunbar, Scott Aaronson

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出宽神经网络作为计算无巧合猜想的基线,通过证明具有零均值激活函数的神经网络输出几乎独立,以衡量AI可解释性的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03544 2026-01-13 math.OC cs.AI cs.RO 57%

Agile Tradespace Exploration for Space Rendezvous Mission Design via Transformers

通过变换器实现空间交汇任务设计的敏捷贸易空间探索

Yuji Takubo, Daniele Gammelli, Marco Pavone, Simone D'Amico

机构 * Dept. of Aeronautics & Astronautics Stanford University(航空与航天系 斯坦福大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于变换器的框架,实现快速生成多目标交汇任务的帕累托最优轨迹,提升任务设计效率与灵活性。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00828 2026-01-13 cs.CR cs.AI 57%

Towards Ultra-Low Latency: Binarized Neural Network Architectures for In-Vehicle Network Intrusion Detection

迈向超低延迟:用于车载网络入侵检测的二值化神经网络架构

Huiyao Dong, Igor Kotenko

机构 * Faculty of Information Technology and Security(信息科技与安全学院) ITMO University(ITMO大学) Laboratory of Computer Security Problems(计算机安全问题实验室) St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS)(俄罗斯科学院圣彼得堡联邦科研中心(SPC RAS))

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于二值化神经网络的轻量级入侵检测方法,通过混合二进制编码技术提升车载网络安全性,适用于实时通信场景。

Comments 6 pages, accepted and presented at INISTA 2025 (https://conferences.sigappfr.org/inista2025/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04791 2026-01-13 cs.AI 57%

What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking

大型语言模型的What-If分析:通过前瞻性思维探索游戏世界

Yuan Sui, Yanming Zhang, Yi Liao, Yu Gu, Guohua Tang, Zhongqian Sun, Wei Yang, Bryan Hooi

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00140 2026-01-13 cs.SE cs.AI 57%

LLM-based Zero-shot Triple Extraction for Automated Ontology Generation from Software Engineering Standards

基于大型语言模型的零样本三元组提取用于从软件工程标准自动生成本体

Songhui Yue

机构 * Computer Science Department(计算机科学系) Charleston Southern University(查尔斯顿南方大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于LLM的零样本三元组提取方法,用于从软件工程标准中自动生成本体,通过改进的工作流程和专家标注集验证了其有效性。

Comments Semantic Data Integration Workshop, held in conjunction with IEEE International Conference on Semantic Computing (IEEE ICSC 2026), accepted, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05399 2026-01-12 cs.CV cs.AI cs.IR 57%

Multi-task Cross-modal Learning for Chest X-ray Image Retrieval

多任务跨模态学习用于胸部X射线图像检索

Zhaohui Liang, Sivaramakrishnan Rajaraman, Niccolo Marini, Zhiyun Xue, Sameer Antani

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出多任务学习框架,通过改进BiomedCLIP模型,提升胸部X射线图像与文本的跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17802 2026-01-12 cs.LG 57%

LEKA:LLM-Enhanced Knowledge Augmentation

LEKA:大语言模型增强的知识增强

Xinhao Zhang, Jinghan Zhang, Fengran Mo, Dongjie Wang, Yanjie Fu, Kunpeng Liu

机构 * Portland State University(波特兰州立大学) University of Montreal(蒙特利尔大学) University of Kansas(堪萨斯大学) Arizona State University(亚利桑那州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 LEKA通过主动检索合适知识源,提升跨领域知识转移效率,减少计算成本并优化迁移学习效果。

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02954 2026-01-12 cs.CL 57%

DQ-LoRe: Dual Queries with Low Rank Approximation Re-ranking for In-Context Learning

DQ-LoRe:双查询与低秩近似重排序用于上下文学习

Jing Xiong, Zixuan Li, Chuanyang Zheng, Zhijiang Guo, Yichun Yin, Enze Xie, Zhicheng Yang, Qingxing Cao, Haiming Wang, Xiongwei Han, Jing Tang, Chengming Li, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) MBZUAI The Hong Kong University of Science and Technology(香港科学与技术大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) DarkMatter AI Research(DarkMatter AI研究)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 DQ-LoRe通过双查询与低秩近似重排序方法提升GPT-4上下文学习性能,实现94.2%的性能提升。

Comments Accepted in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04940 2026-01-09 cs.CR cs.AI 57%

CurricuLLM: Designing Personalized and Workforce-Aligned Cybersecurity Curricula Using Fine-Tuned LLMs

CurricuLLM: 利用微调大语言模型设计个性化且与劳动力市场对齐的网络安全课程

Arthur Nijdam, Harri Kähkönen, Valtteri Niemi, Paul Stankovski Wagner, Sara Ramezanian

机构 * Lund University, Department of Electrical University of Helsinki, Department of Computer Science, Helsinki, Finland Helsinki Institute for Information Technology, Helsinki, Finland Karlstad University, Department of Mathematics \& Computer Science, Karlstad, Sweden

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 CurricuLLM通过微调大语言模型设计个性化且与劳动力市场对齐的网络安全课程,解决课程与行业需求不匹配的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04888 2026-01-09 cs.AI 57%

SmartSearch: Process Reward-Guided Query Refinement for Search Agents

SmartSearch: 基于过程奖励的查询优化用于搜索代理

Tongyu Wen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SmartSearch通过过程奖励和查询优化机制提升搜索代理的查询质量与效率。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04670 2026-01-09 cs.LG 57%

Learning Dynamics in RL Post-Training for Language Models

在语言模型中学习动态的强化学习后训练

Akiyoshi Tomihari

机构 * Department of Computer Science, The University of Tokyo(东京大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出分类器优先强化学习(CF-RL),通过优先更新分类器来提升语言模型的对齐性和推理能力,揭示了RL后训练中学习动态的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04545 2026-01-09 cs.AI cs.PF 57%

Personalized Model-Based Design of Human Centric AI enabled CPS for Long term usage

面向长期使用的以人为本的人工智能增强型控制系统个性化建模设计

Bernard Ngabonziza, Ayan Banerjee, Sandeep K. S. Gupta

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出个性化建模方法,以解决人工智能增强的人本控制系统在长期使用中的安全、可持续性和安全性分析问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04381 2026-01-09 cs.CV cs.AI 57%

Few-Shot LoRA Adaptation of a Flow-Matching Foundation Model for Cross-Spectral Object Detection

为跨光谱目标检测的流匹配基础模型进行少样本LoRA适应

Maxim Clouser, Kia Khezeli, John Kalantari

机构 * Yrikka Inc.(Yrikka公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 通过少样本LoRA适应流匹配基础模型,实现跨光谱目标检测的合成数据生成与提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03948 2026-01-09 cs.AI q-fin.TR 57%

Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification

Trade-R1: 通过过程级推理验证弥合可验证奖励与随机环境

Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Trade-R1通过过程级推理验证,将可验证奖励与随机金融环境连接,减少奖励黑客问题,DSR在跨市场泛化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03845 2026-01-08 cs.AI cs.LO 57%

Formally Explaining Decision Tree Models with Answer Set Programming

用答案集编程形式解释决策树模型

Akihiro Takemura, Masayuki Otani, Katsumi Inoue

机构 * National Institute of Informatics, Tokyo, Japan(日本信息处理研究院) Tokyo Institute of Technology, Tokyo, Japan(东京技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出利用答案集编程生成决策树模型多种解释的方法,以提升模型的可解释性与形式化验证能力。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 420-437

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03477 2026-01-08 cs.LG 57%

Hybrid Approach for Driver Behavior Analysis with Machine Learning, Feature Optimization, and Explainable AI

融合机器学习、特征优化与可解释AI的驾驶员行为分析方法

Mehedi Hasan Shuvo, Md. Raihan Tapader, Nur Mohammad Tamjid, Sajjadul Islam, Ahnaf Atef Choudhury, Jia Uddin

机构 * Department of CSE, DUET Gazipur, Bangladesh Department of IST, George Mason University Fairfax, USA AI \& Big Data Department, Woosong University Daejeon, South Korea

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出融合机器学习、特征优化和可解释AI的方法,通过特征分析和模型优化提升驾驶员行为预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03376 2026-01-08 cs.LG 57%

Weather-Aware Transformer for Real-Time Route Optimization in Drone-as-a-Service Operations

考虑天气的变换器用于无人机即服务操作中的实时路线优化

Kamal Mohamed, Lillian Wassim, Ali Hamdi, Khaled Shaban

机构 * Dept. of Computer Science, Qatar University, Doha, Qatar(计算机科学系,卡塔尔大学,多哈)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出一种天气感知的变换器框架,用于实时优化无人机即服务操作的路线,通过天气启发式方法提升动态环境下的路由决策效率与安全性。

Comments 2025 IEEE/ACS 22nd International Conference on Computer Systems and Applications (AICCSA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01584 2026-01-07 cs.CL 57%

Steerability of Instrumental-Convergence Tendencies in LLMs

在大语言模型中操控工具收敛倾向的可行性

Jakub Hoscilowicz

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 该研究通过反工具提示显著降低大语言模型的收敛率,揭示了可控性与安全之间的矛盾,为AI系统的设计提供了新的安全策略。

Comments Code is available at https://github.com/j-hoscilowicz/instrumental_steering

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21170 2026-01-06 cs.CL 57%

Cosmos: Compressed and Smooth Latent Space for Text Diffusion Modeling

Cosmos: 用于文本扩散建模的压缩和平滑潜在空间

Viacheslav Meshchaninov, Egor Chimbulatov, Alexander Shabalin, Aleksandr Abramov, Dmitry Vetrov

机构 * HSE University(俄罗斯高等经济大学) Constructor University(建设大学) SaluteDevices

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Cosmos通过压缩和平滑的潜在空间提升文本生成效率,实现比传统方法更快的推理速度和相当的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09665 2026-01-06 cs.SI cs.CL 57%

Tales of the 2025 Los Angeles Fire: Hotwash for Public Health Concerns in Reddit via LLM-Enhanced Topic Modeling

2025年洛杉矶火灾故事:通过LLM增强的专题建模在Reddit上进行公共健康担忧的热洗

Sulong Zhou, Qunying Huang, Shaoheng Zhou, Yun Hang, Xinyue Ye, Aodong Mei, Kathryn Phung, Yuning Ye, Uma Govindswamy, Zehan Li

机构 * Department of Landscape Architecture and Urban Planning & Urban Artificial Intelligence Lab, Texas A&M University(景观建筑与城市规划系及城市人工智能实验室,德克萨斯农工大学) Geography, University of Wisconsin-Madison(地理系,威斯康星大学麦迪逊分校) Google(谷歌) Department of Environmental and Occupational Health Sciences, School of Public Health, University of Texas Health Science Center at Houston(环境与职业健康科学系,公共卫生学院,德克萨斯健康科学中心休斯顿分部) McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(麦克威廉斯生物医学信息学学院,德克萨斯健康科学中心休斯顿分部)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本研究通过LLM增强的专题建模分析2025年洛杉矶野火期间Reddit上的公众言论,识别出公共健康担忧和心理健康风险,构建了分层框架用于危机话语分析。

Comments Fix typos in Method Section. Add data/code availability

详情

展开后加载摘要…

URL PDF HTML 收藏