arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7608 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7608 篇

2603.18598 2026-03-20 cs.CV 50%

Complementary Text-Guided Attention for Zero-Shot Adversarial Robustness

互补文本引导注意力用于零样本对抗鲁棒性

Lu Yu, Haiyang Zhang, Changsheng Xu

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of the Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出TGA-ZSR和Comp-TGA方法,通过局部注意力细化模块和全局注意力约束模块提升CLIP模型的零样本对抗鲁棒性,实验显示在16个数据集上分别提升9.58%和11.95%。

Comments Accepted to TPAMI 2026. arXiv admin note: substantial text overlap with arXiv:2410.21802

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04714 2026-03-20 cs.CV 50%

Object-Centric Representation Learning for Enhanced 3D Semantic Scene Graph Prediction

面向增强三维语义场景图预测的对象感知表示学习

KunHo Heo, GiHyun Kim, SuYeon Kim, MyeongAh Cho

机构 * Kyung Hee University(庆熙大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出一种高判别性的对象特征编码器和对比预训练策略,提升三维语义场景图预测的准确性和关系预测能力,实验表明在3DSSG数据集上优于现有方法。

Comments Accepted by NeurIPS 2025. Code: https://github.com/VisualScienceLab-KHU/OCRL-3DSSG-Codes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12789 2026-03-19 cs.CV 50%

Coherent Human-Scene Reconstruction from Multi-Person Multi-View Video in a Single Pass

从多视角多人物视频中单次通过进行一致的人-场景重建

Sangmin Kim, Minhyuk Hwang, Geonho Cha, Dongyoon Wee, Jaesik Park

机构 * Seoul National University(首尔国立大学) NAVER Cloud(NAVER云)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出CHROMM框架,通过单次处理联合估计相机、场景点云和人体网格,无需额外模块或预处理,提升多视角人体姿态估计性能。

Comments Project page: https://nstar1125.github.io/chromm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16099 2026-03-18 cs.CV 50%

OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder

OneWorld: 通过3D统一表示自编码器驯服场景生成

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Tongliang Liu, Mingming Gong, Jiawang Bian

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) AISphere Shanghai Jiao Tong University(上海交通大学) University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 OneWorld通过3D统一表示自编码器直接在3D空间中进行扩散,解决跨视角一致性和几何一致性问题,实验表明其生成的3D场景质量优于现有2D方法。

Comments Code: https://github.com/SensenGao/OneWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05823 2026-03-17 cs.CV 50%

Boosting Latent Diffusion Models via Disentangled Representation Alignment

通过解耦表征对齐提升潜在扩散模型

John Page, Xuesong Niu, Kai Wu, Kun Gai

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出Semantics-Disentangled VAE,通过非线性映射架构提升VAE的语义解耦能力,实现高质量图像生成,FID达1.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19703 2026-03-17 cs.HC 50%

Interactive Discovery and Exploration of Visual Bias in Generative Text-to-Image Models

交互式发现和探索生成文本到图像模型中的视觉偏见

Johannes Eschner, Roberto Labadie-Tamayo, Matthias Zeppelzauer, Manuela Waldner

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 本文提出ViBEx工具,通过交互式界面和零样本偏见探测,帮助发现生成文本到图像模型中的视觉偏见,通过案例研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13999 2026-03-17 cs.SE 50%

ReqToCode: Embedding Requirements Traceability as a Structural Property of the Codebase

ReqToCode:将需求可追溯性作为代码库的结构属性进行嵌入

Thorsten Schlathölter

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 本文提出ReqToCode方法,通过将可追溯性元素直接嵌入代码库,使可追溯性成为编译时可验证的系统属性,而非外部文档任务。

Comments 23 pages. Preprint. Not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13884 2026-03-17 cs.CV 50%

SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis

SCoCCA: 通过典型相关分析进行多模态稀疏概念分解

Ehud Gordon, Meir Yossef Levi, Guy Gilboa

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13770 2026-03-17 cs.CV 50%

PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment

PhysAlign:通过特征和3D表示对齐实现物理一致的图像到视频生成

Zhexiao Xiong, Yizhi Song, Liu He, Wei Xiong, Yu Yuan, Feng Qiao, Nathan Jacobs

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 PhysAlign通过特征和3D表示对齐,解决图像到视频生成中的物理一致性问题,提升复杂物理推理和时间稳定性,同时保持零样本视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12265 2026-03-13 cs.CV 50%

OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams

OmniStream:在连续流中掌握感知、重建与行动

Yibin Yan, Jilan Xu, Shangzhe Di, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, SJTU(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) VGG, Oxford(牛津大学视觉几何组)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 OmniStream通过统一的流视觉骨干网络,实现对视频流中感知、重建和行动的高效处理,展示了在多种任务上的通用性与竞争力。

Comments Technical Report. Project Page: https://go2heart.github.io/omnistream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10470 2026-03-12 cs.CV 50%

Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression

用反事实对抗幻觉:基于扩散引导的扰动用于LVLM幻觉抑制

Hamidreza Dastmalchi, Aijun An, Ali Cheraghian, Hamed Barzamini

机构 * York University(约克大学) Macquarie University(麦考瑞大学) Northern Illinois University(北伊利诺伊大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 CIPHER通过反事实图像扰动减少LVLM中的视觉幻觉,提升模型忠实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01957 2026-03-12 cs.CV 50%

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

AFTER: 通过自适应事实引导激活编辑缓解LVLM中的对象幻觉

Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 AFTER通过自适应事实引导激活编辑缓解LVLM中的对象幻觉,显著降低幻觉发生率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05170 2026-03-12 cs.CV 50%

Leveraging Spatial Context for Positive Pair Sampling in Histopathology Image Representation Learning

利用空间上下文进行组织病理图像表示学习中的正对采样

Willmer Rafell Quinones Robles, Sakonporn Noree, Jongwoo Kim, Young Sin Ko, Bryan Wong, Mun Yong Yi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Seegene Medical Foundation(Seegene医学基金会)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出一种利用空间上下文提升组织病理图像自监督学习性能的方法,通过改进正对采样策略,在多个数据集上实现了5%-10%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09466 2026-03-11 cs.CV 50%

TopoOR: A Unified Topological Scene Representation for the Operating Room

TopoOR: 一种用于手术室的统一拓扑场景表示

Tony Danjun Wang, Ka Young Kim, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院) Kyung Hee University(韩国庆熙大学)

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 TopoOR通过更高阶拓扑结构建模手术室的多模态特性,提升场景表达能力,优于传统图和LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07170 2026-03-11 cs.CV 50%

Class Visualizations and Activation Atlases for Enhancing Interpretability in Deep Learning-Based Computational Pathology

基于类可视化和激活图谱的深度学习计算病理学解释性增强

Marco Gustav, Fabian Wolf, Christina Glasner, Nic G. Reitsam, Stefan Schulz, Kira Aschenbroich, Bruno Märkl, Sebastian Foersch, Jakob Nikolas Kather

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本研究提出基于类可视化和激活图谱的深度学习计算病理学解释性增强方法,通过评估不同标签粒度下的模型表现,揭示了变压器模型中的结构化形态流形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07071 2026-03-11 cs.CV 50%

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20223 2026-03-11 cs.CV 50%

V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs

V-Attack:针对解耦价值特征的可控对抗攻击LVLMs

Sen Nie, Jie Zhang, Jianxin Yan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 V-Attack通过精准操控LVLMs中的价值特征,提升对抗攻击的成功率,揭示视觉语言理解的关键漏洞。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05875 2026-03-11 cs.SD 50%

LARA-Gen: Enabling Continuous Emotion Control for Music Generation Models via Latent Affective Representation Alignment

LARA-Gen:通过潜在情感表示对齐实现音乐生成模型的连续情绪控制

Jiahao Mei, Xuenan Xu, Zeyu Xie, Zihao Zheng, Ye Tao, Yue Ding, Mengyue Wu

机构 * X-LANCE Lab, Shanghai Jiao Tong University, China(上海交通大学X-LANCE实验室) Shanghai AI Lab, China(上海人工智能实验室) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine, China(上海交通大学医学院精神卫生中心)

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 LARA-Gen通过潜在情感表示对齐实现音乐生成模型的连续情绪控制,提升情绪可控性和音乐质量。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08303 2026-03-10 cs.HC 50%

Do Models See in Line with Human Vision? Probing the Correspondence Between LVLM Representations and EEG Signals

模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系

Xin Xiao, Yang Lei, Haoyang Zeng, Xiao Sun, Xinyi Jiang, Yu Tian, Hao Wu, Kaiwen Wei, Jiang Zhong

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11952 2026-03-10 cs.CV 50%

UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding

UniUGG: 通过几何-语义编码实现统一的3D理解与生成

Yueming Xu, Jiahui Zhang, Ze Huang, Yurui Chen, Yanpeng Zhou, Zhenyu Chen, Yu-Jie Yuan, Pengxiang Xia, Guowei Huang, Xinyue Cai, Zhongang Qi, Xingyue Quan, Jianye Hao, Hang Xu, Li Zhang

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07074 2026-03-10 cs.CV 50%

Physics-Guided VLM Priors for All-Cloud Removal

物理引导的VLM先验条件用于全云去除

Liying Xu, Huifang Li, Huanfeng Shen

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出PhyVLM-CR方法,结合VLM语义能力和物理模型,实现高保真全云去除,提升云去除与内容保留的平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08851 2026-03-10 cs.RO 50%

CDE: Concept-Driven Exploration for Reinforcement Learning

CDE:基于概念的强化学习探索

Le Mao, Andrew H. Liu, Renos Zabounidis, Yanan Niu, Zachary Kingston, Joseph Campbell

机构 * Department of Electrical and Computer Engineering, Purdue University(电子工程系,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学) Department of Management of Technology, EPFL(技术管理系,瑞士联邦理工学院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 CDE通过利用预训练视觉-语言模型生成任务相关的视觉概念,提升强化学习中视觉任务的探索效率和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05787 2026-03-09 cs.CV 50%

Spectral Probing of Feature Upsamplers in 2D-to-3D Scene Reconstruction

特征上采样器在2D到3D场景重建中的频谱探测

Ling Xiao, Yuliang Xiu, Yue Chen, Guoming Wang, Toshihiko Yamasaki

机构 * Hokkaido University(北海道大学) Westlake University(西湖大学) Zhejiang University(浙江大学) The University of Tokyo(东京大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出频谱诊断框架,通过六个指标评估特征上采样器对3D重建的影响,发现频谱一致性比空间细节更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05655 2026-03-09 physics.chem-ph 50%

Latent space design of interatomic potentials

原子间势能的潜在空间设计

Susan R. Atlas

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出了一种基于第一性原理和DFT定理的原子间势能设计方法,通过构建潜在空间模式和量子嵌入,实现简洁且物理基础的势能表示,提升预测和解释能力。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05629 2026-03-09 cs.CV 50%

Rethinking Concept Bottleneck Models: From Pitfalls to Solutions

重新思考概念瓶颈模型:从误区到解决方案

Merve Tapli, Quentin Bouniot, Wolfgang Stammer, Zeynep Akata, Emre Akbas

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 CBM-Suite通过引入熵度量、非线性层和蒸馏损失,系统解决概念瓶颈模型的准确性、可解释性和系统性研究问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18056 2026-03-09 cs.CV 50%

Escaping The Big Data Paradigm in Self-Supervised Representation Learning

在自监督表征学习中摆脱大数据范式

Carlos Vélez García, Miguel Cazorla, Jorge Pomares

机构 * Institute for Computer Science(计算机科学研究所) University of Alicante(阿利坎特大学) DFISTS

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出SCOTT和MIM-JEPA方法,在小数据下实现高效自监督表征学习,无需大规模数据集。

Comments Code and implementation available at: https://github.com/inescopresearch/scott

Journal ref Computer Vision and Image Understanding, 2026, 104698

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03544 2026-03-05 cs.CV 50%

PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest

PinCLIP:Pinterest的规模化多模态基础表示

Josh Beal, Eric Kim, Jinfeng Rao, Rex Wu, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest Inc.(Pinterest公司)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 PinCLIP通过多模态表示学习提升Pinterest的检索和排序模型,解决冷启动问题并提高用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01873 2026-03-03 q-bio.BM 50%

Bi-TEAM: A Unified Cross-Scale Representation Learning Framework for Chemically Modified Biomolecules

Bi-TEAM:一种统一的跨尺度表示学习框架用于化学修饰的生物分子

Chunbin Gu, Zijun Gao, Mutian He, Jingjie Zhang, Haipeng Wen, Zihao Luo, Xiaorui Wang, Hanqun Cao, Jiajun Bu, Chang-Yu Hsieh, Pheng Ann Heng

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 Bi-TEAM 通过统一生物语义与化学精度,提供了一种统一的跨尺度表示学习框架,用于化学修饰生物分子的高效建模与预测。

Comments 57 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00088 2026-03-03 cs.CY 50%

AI Safety Evaluations Need To Consider Cascading Effects

AI安全评估需要考虑连锁效应

Anna Neumann, Jatinder Singh

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出通过分析AI供应链中各组件的连锁效应,改进AI安全评估方法,以提升系统透明度和安全性。

Comments As accepted in the IASEAI 2026 Proceedings, Track 11: Epistemological challenges of AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21965 2026-02-27 cs.CV 50%

PartSAM: A Scalable Promptable Part Segmentation Model Trained on Native 3D Data

PartSAM: 一种可提示的部件分割模型,基于原生3D数据训练

Zhe Zhu, Le Wan, Rui Xu, Yiheng Zhang, Honghua Chen, Zhiyang Dou, Cheng Lin, Yuan Liu, Mingqiang Wei

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Lingnan University(岭南大学) Macau University of Science and Technology(澳门科学理工学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 PartSAM是一种基于大规模3D数据训练的可提示部件分割模型,通过三平面双分支编码器实现可扩展的部件感知表示学习,能够通过单个提示实现高精度部件识别,并自动分解为表面和内部结构。

Comments ICLR 2026. Project Page: https://czvvd.github.io/PartSAMPage/

详情

展开后加载摘要…

URL PDF HTML 收藏