arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2603.05344 2026-03-16 cs.AI 57%

Building Effective AI Coding Agents for the Terminal: Scaffolding, Harness, Context Engineering, and Lessons Learned

构建高效的AI编码代理:支架、驾驭、上下文工程及经验教训

Nghi D. Q. Bui

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出OPENDEV,一种基于命令行的开源编码代理,通过安全控制、高效上下文管理及自适应压缩技术,实现终端优先的自主软件工程支持。

Comments Work in progress, new versions will be updated continuously

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22954 2026-03-16 cs.AI 57%

Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

达尔文戈德尔机器:自我改进代理的开放性进化

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出达尔文戈德尔机器,通过迭代修改自身代码并验证改进,实现自我提升,提升代码能力并在多个基准测试中取得显著成绩。

Comments Code at https://github.com/jennyzzt/dgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11970 2026-03-13 cs.LG 57%

Statistical and structural identifiability in representation learning

表示学习中的统计和结构可识别性

Walter Nelson, Marco Fumero, Theofanis Karaletsos, Francesco Locatello

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出统计和结构近可识别性概念,通过ICA后处理实现表示学习中的去纠缠,验证了在合成数据和细胞显微镜中的有效性。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI 57%

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10877 2026-03-12 cs.CL 57%

From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers

从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移

Ayan Sengupta, Shantanu Dixit, Md Shad Akhtar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10052 2026-03-12 cs.RO cs.LG 57%

OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies

OmniGuide: 通用引导场用于增强通用机器人策略

Yunzhou Song, Long Le, Yong-Hyun Park, Jie Wang, Junyao Shi, Lingjie Liu, Jiatao Gu, Eric Eaton, Dinesh Jayaraman, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 OMNIGUIDE通过整合多种引导源提升通用机器人策略在复杂任务中的性能

Comments Project Page: $\href{https://omniguide.github.io/}{this\; url}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02816 2026-03-12 cs.CV cs.AI 57%

BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation

BrandFusion: 一种多智能体框架,用于文本到视频生成中的无缝品牌整合

Zihao Zhu, Ruotong Wang, Siwei Lyu, Min Zhang, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) State University of New York at Buffalo(纽约州立大学布法罗分校) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 BrandFusion通过多智能体框架实现文本到视频生成中的无缝品牌整合,提升品牌辨识度和内容自然度,推动T2V的可持续商业化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24224 2026-03-12 cs.LG 57%

Proposing a Framework for Machine Learning Adoption on Legacy Systems

为遗留系统采用机器学习提出一个框架

Ashiqur Rahman, Hamed Alhoori

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出一个基于API的框架,通过解耦ML模型生命周期与生产环境,为遗留系统提供轻量级浏览器界面,减少升级成本和生产中断,提升制造业生产质量与安全。

Comments Accepted at The First International Workshop on Resilient Artificial Intelligence for Manufacturing (ICDM'25)

Journal ref 2025 IEEE International Conference on Data Mining Workshops (ICDMW), Washington, DC, USA, 2025, pp. 1616-1623

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04233 2026-03-12 cs.LG cs.SI 57%

Graph machine learning for flight delay prediction due to holding manouver

基于图机器学习的飞行延误预测:因等待 maneuver 引起的延误

Jorge L. Franco, Manoel V. Machado Neto, Filipe A. N. Verri, Diego R. Amancio

机构 * Institute of Mathematics and Computer Science, University of São Paulo(圣保罗大学数学与计算机科学研究所) Aeronautical Technology Institute – ITA(航空技术研究所 – ITA)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本研究利用图机器学习方法预测因等待 maneuver 引起的飞行延误,通过CatBoost和GATs模型提升预测精度并提供可解释性,以提高航空运营效率。

Journal ref Physica A 685, 131318 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09727 2026-03-11 cs.LG 57%

A Multi-Prototype-Guided Federated Knowledge Distillation Approach in AI-RAN Enabled Multi-Access Edge Computing System

在AI-RAN赋能的多接入边缘计算系统中的一种多原型引导的联邦知识蒸馏方法

Luyao Zou, Hayoung Oh, Chu Myaet Thwal, Apurba Adhikary, Seohyeon Hong, Zhu Han

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种多原型引导的联邦知识蒸馏方法,用于解决AI-RAN赋能的多接入边缘计算系统中非独立和相同分布数据的问题,通过引入自我知识蒸馏和多原型策略提升模型性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08755 2026-03-11 cs.PL cs.AI cs.SE 57%

Turn: A Language for Agentic Computation

Turn:一种用于代理计算的语言

Muyukani Kizito

机构 * Turn Lang(Turn语言) Prescott Data(Prescott数据)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 Turn是一种用于代理计算的编译型语言,通过类型安全、能力身份系统和编译时模式吸收等机制,实现对大型语言模型推断的可靠控制和安全管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21609 2026-03-11 cs.CV cs.LG 57%

VLCE: A Knowledge-Enhanced Framework for Image Description in Disaster Assessment

VLCE:一种用于灾害评估图像描述的知识增强框架

Md. Mahfuzur Rahman, Kishor Datta Gupta, Marufa Kamal, Fahad Rahman, Sunzida Siddique, Ahmed Rafi Hasan, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) BRAC University(布拉克大学) United International University(国际联合大学) Daffodil International University(花王国际大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 VLCE通过整合知识图谱提升灾害影像描述的准确性和领域相关性,其在RescueNet上优于QwenVL基线。

Comments 28 pages, 30 figures, 1 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08544 2026-03-10 cs.RO cs.LG 57%

The Neural Compass: Probabilistic Relative Feature Fields for Robotic Search

神经罗盘:基于概率相对特征场的机器人搜索

Gabriele Somaschini, Adrian Röfer, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出ProReFF模型,通过概率相对特征场实现机器人搜索任务中的高效物体定位,实验表明其在模拟环境中比基线方法更高效,接近人类水平性能。

Comments 9 pages, 7 figures, 2 tables, submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08436 2026-03-10 cs.CV cs.CL 57%

Can Vision-Language Models Solve the Shell Game?

视觉-语言模型能解决贝壳游戏吗?

Tiedong Liu, Wee Sun Lee

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出SGCoT方法,通过生成对象轨迹解决VLMs在视觉跟踪中的根本限制,实现超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05437 2026-03-10 cs.CV cs.AI 57%

SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

SAIL:基于相似性感知引导和跨字幕增强学习的弱监督密集视频字幕生成

Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, Minju Jeon, Hyungee Kim, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SAIL通过跨模态对齐和大语言模型增强策略,提升弱监督密集视频字幕生成的准确性和语义感知能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08165 2026-03-10 cs.SE cs.AI 57%

An explainable hybrid deep learning-enabled intelligent fault detection and diagnosis approach for automotive software systems validation

一种可解释的混合深度学习智能故障检测与诊断方法用于汽车软件系统验证

Mohammad Abboush, Ehab Ghannoum, Andreas Rausch

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的混合深度学习方法,用于汽车软件系统验证中的故障检测与诊断,通过可解释AI技术提升模型适应性和根本原因分析能力。

Comments 20 pages

Journal ref Knowledge-Based Systems Volume 334, 15 February 2026, 114922

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI 57%

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07241 2026-03-10 cs.LG cs.IR 57%

Rethinking Deep Research from the Perspective of Web Content Distribution Matching

从网页内容分布匹配视角重新思考深度研究

Zixuan Yu, Zhenheng Tang, Tongliang Liu, Chengqi Zhang, Xiaowen Chu, Bo Han

机构 * School of Computer science and engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) CSE, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) DSA Thrust, The Hong Kong University of Science and Technology (GuangZhou)(数据科学与技术 thrust,香港科学与技术大学(广州)) TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR 组,计算机科学系,香港 Baptist 大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 WeDas通过引入网页内容分布感知机制,改进深度搜索代理的查询-结果对齐能力,提升子目标完成和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16987 2026-03-10 cs.LG 57%

From Model Explanation to Data Misinterpretation: A Cautionary Analysis of Post Hoc Explainers in Business Research

从模型解释到数据误读:对事后解释器在商业研究中使用的警示分析

Tong Wang, Ronilo Ragodos, Lu Feng, Yu, Hu

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文警示事后解释器在商业研究中用于假设检验的不足,指出其作为探索性工具生成而非验证实质性见解的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06459 2026-03-09 cs.CV cs.AI 57%

Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement

基础模型知道几何吗?通过冻结特征进行连续物理测量

Yakov Pyotr Shkolnikov

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究发现视觉-语言模型通过冻结特征可实现连续几何测量,LoRA微调和架构分析揭示了路径训练缺陷及中层注意力头对几何信号的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06024 2026-03-09 cs.CL cs.CV 57%

ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning

ViewFusion:多视角推理的结构化空间思维链

Xingjian Tao, Yiwei Wang, Yujun Cai, Yifan Song, Jing Tang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 ViewFusion通过两阶段框架提升多视角推理准确率,通过空间预对齐与问题驱动推理结合,有效提升复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22289 2026-03-09 q-bio.QM cs.LG q-bio.GN 57%

What Topological and Geometric Structure Do Biological Foundation Models Learn? Evidence from 141 Hypotheses

生物基础模型学习了哪些拓扑和几何结构?来自141个假设的证据

Ihor Kendiukhov

机构 * Department of Computer Science University of Tübingen(计算机科学系图宾根大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 生物基础模型通过大规模假设筛选发现,其学习的几何结构具有生物意义,且在不同模型间共享,但基因位置存在差异,同时信号在免疫组织中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13350 2026-03-09 cs.LG 57%

Beyond Mapping : Domain-Invariant Representations via Spectral Embedding of Optimal Transport Plans

超越映射:通过最优运输计划的谱嵌入获得领域不变表示

Abdel Djalil Sad Saoud, Fred Maurice Ngolè Mboula, Hanane Slimani

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过谱嵌入平滑运输计划来获得领域不变表示,以解决训练与推理数据分布偏移问题,在多个音频和电气检测任务中取得优异性能。

Comments Accepted at The IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03738 2026-03-09 cs.CL 57%

Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs

激活空间人格引导:用于LLMs中稳定特质控制的混合层选择

Pranav Bhandari, Nicolas Fay, Sanjeevan Selvaganapathy, Amitava Datta, Usman Naseem, Mehwish Nasim

机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) School of Physics Maths and Computing, The University of Western Australia(西澳大学物理数学与计算学院) School of Psychological Science, The University of Western Australia(西澳大学心理学科学学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过混合层选择方法,在LLMs中实现稳定的人格控制,利用Big Five人格特质构建低秩子空间,以提升模型输出的可控性与实用性。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17859 2026-03-09 eess.SY cs.LG cs.SY 57%

Mixed Monotonicity Reachability Analysis of Neural ODE: A Trade-Off Between Tightness and Efficiency

神经ODE的混合单调性可达性分析:紧致性与效率之间的权衡

Abdelrahman Sayed Sayed, Pierre-Jean Meyer, Mohamed Ghazel

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于区间的方法,利用混合单调性技术对神经ODE进行可达性分析,在紧致性和效率之间取得平衡,适用于高维实时安全应用。

Comments 27 pages, 11 figures, Accepted for publication in PMLR proceedings of NeurReps 2025 co-located with NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06265 2026-03-09 cs.CV cs.AI 57%

SPARC: Concept-Aligned Sparse Autoencoders for Cross-Model and Cross-Modal Interpretability

SPARC:概念对齐的稀疏自编码器用于跨模型和跨模态可解释性

Ali Nasiri-Sarvi, Hassan Rivaz, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE) Concordia University, Canada(计算机科学与软件工程系(CSSE)康科迪亚大学,加拿大) Department of Electrical and Computer Engineering (ECE) Concordia University, Canada(电气与计算机工程系(ECE)康科迪亚大学,加拿大)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SPARC通过稀疏自编码器实现跨模型和跨模态的概念对齐,提升概念表示的一致性与可解释性

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03946 2026-03-05 cs.LG 57%

Lang2Str: Two-Stage Crystal Structure Generation with LLMs and Continuous Flow Models

Lang2Str: 基于LLM和连续流模型的双阶段晶体结构生成

Cong Liu, Chengyue Gong, Zhenyu Liu, Jiale Zhao, Yuxuan Zhang

机构 * AMLab, AI4Science Lab University of Amsterdam(AMLab、AI4Science Lab 阿姆斯特丹大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 Lang2Str通过结合LLM和流模型,实现灵活且精确的晶体结构生成,提升材料设计的效率和定制性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03644 2026-03-05 cs.HC cs.AI 57%

Bridging Pedagogy and Play: Introducing a Language Mapping Interface for Human-AI Co-Creation in Educational Game Design

连接教学与游戏:引入一种语言映射接口用于教育游戏设计中的人机协同创作

Daijin Yang, Erica Kleinman, Casper Harteveld

机构 * Northeastern University(东北大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于语言映射的接口,通过人机协同设计教育游戏,以明确教学意图并降低非专业设计师的设计门槛。

Comments Accepted for CHI EA 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03623 2026-03-05 cs.CL econ.EM 57%

A Neural Topic Method Using a Large-Language-Model-in-the-Loop for Business Research

基于循环大型语言模型的神经主题方法用于商业研究

Stephan Ludwig, Peter J. Danaher, Xiaohao Yang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 LX Topic通过整合大型语言模型细化,提升主题建模的可重复性、可解释性和测量导向性,用于商业研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26905 2026-03-05 cs.AI 57%

Cognition Envelopes for Bounded Decision Making in Autonomous UAS Operations

认知边界用于自主无人机操作中的有限决策

Pedro Antonio Alarcon Granadeno, Arturo Miguel Bernal Russell, Sofia Nelson, Demetrius Hernandez, Maureen Petterson, Michael Murphy, Walter J. Scheirer, Jane Cleland-Huang

机构 * University of Notre Dame(诺特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出认知边界概念,用于约束自主无人机在搜索救援任务中的决策,结合概率推理和资源分析,以减少 AI 生成决策中的错误。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏