arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7583 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7583 篇

2605.13352 2026-08-04 cs.LG 版本更新 57%

GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

GeoFlowVLM: 基于几何的联合不确定性用于冻结视觉-语言嵌入

Mayank Nautiyal, Li Ju, Andreas Hellander, Ekta Vats, Prashant Singh

机构 * Department of Information Technology, Uppsala University(乌普萨拉大学信息科技系) SciLifeLab, Uppsala University(乌普萨拉大学SciLifeLab)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 GeoFlowVLM通过流匹配学习双编码VLM嵌入的联合分布,解决视觉-语言模型中缺乏联合不确定性的问题,提出条件检索熵和边际典型性得分以量化不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15534 2026-08-04 eess.IV cs.CV cs.LG 57%

DiCoM -- Diverse Concept Modeling towards Enhancing Generalizability in Chest X-Ray Studies

Abhijeet Parida, Daniel Capellan-Martin, Sara Atito, Muhammad Awais, Maria J. Ledesma-Carbayo, Marius G. Linguraru, Syed Muhammad Anwar

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29240 2026-08-03 cs.CV cs.AI 新提交 57%

When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinations by Selective Prior Calibration

当模型先验与视觉证据冲突时:通过选择性先验校准缓解常识驱动的幻觉

Kesheng Chen, Yamin Hu, Wenjian Luo

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 针对视觉-语言模型的常识驱动幻觉,提出选择性先验校准方法,可提升反事实图像准确率并保留常识图像准确率,增益可推广至多类基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29213 2026-08-03 cs.IR cs.LG 新提交 57%

GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System

GALA:淘宝商购推荐系统中用于自适应多模态表示的生成对齐学习

Jiping Liu, Zhongmin Zhang, Zisen Sang, Zhijia Fang, Tao Ouyang, Ma Jiang, Shaopeng Liang, Zeyang Hou, Guodong Cao, Jia Jia

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 本文针对外卖推荐系统多模态融合难、语义与行为对齐不足的问题,提出三阶段流程GALA,通过生成式RL对齐阶段弥合预训练-微调差距,在淘宝商购部署后提升了订单量与AUC等指标。

Comments 13 pages, 12 figures, 5 tables. Accepted at the 2026 IEEE International Conference on Data Engineering (ICDE 2026), Industry and Applications Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05131 2026-08-03 cs.CV cs.AI cs.RO 版本更新 57%

AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理

Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister

机构 * Southern University of Science and Technology(南方科技大学) Harvard University(哈佛大学) California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。

Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22785 2026-07-30 cs.LG 57%

Navigating the Latent Space Dynamics of Neural Models

神经模型潜在空间动力学导航

Marco Fumero, Luca Moschella, Emanuele Rodolà, Francesco Locatello

机构 * IST Austria(IST奥地利研究院) Sapienza(拉瓦尔大学) Paradigma

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 本文提出将神经模型视为作用于潜在流形上的动态系统,通过潜在向量场分析模型性质与数据特性,实现模型泛化、记忆和异常检测。

Journal ref The Fourteenth International Conference on Learning Representations, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25507 2026-07-29 cs.CL 新提交 57%

Phase Structure in Rotary Attention: A Spectral Framework for Semantic Continuity and Execution-Boundary Governance

旋转注意力中的相位结构:语义连续性和执行边界治理的谱框架

Abraham Chachamovits

机构 * ENTRUST AI(ENTRUST人工智能公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 研究Transformer语言模型中旋转注意力的相位结构,通过定义有效域、推导分数和引入函数构建谱框架,可区分表征连续性与执行边界可接受性,为相关研究提供理论和方法程序。

Comments 14 pages; theoretical framework and proposed experimental program

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24730 2026-07-28 cs.CV cs.AI 新提交 57%

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Vanderbilt University School of Medicine(范德堡大学医学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23924 2026-07-28 cs.CV cs.AI 新提交 57%

DuoAD: Leveraging [CLS] Dual Characteristics for Training-Free Few-Shot Anomaly Detection

DuoAD:利用[CLS]双重特征进行无训练少样本异常检测

Jyun-Ze Tang, Po-Han Huang, Ming-Ching Chang, Chih-Fan Hsu, Jeng-Lin Li

机构 * Inventec Corporation(英业达股份有限公司) University at Albany, State University of New York(纽约州立大学奥尔巴尼分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 研究针对现有视觉基础模型无训练异常检测依赖局部特征、未充分利用全局信息的问题,提出DuoAD框架,利用ViT [CLS]令牌双重特征,通过自动增强选择和注意力引导特征重加权实现无训练少样本异常检测,取得优异结果并建立新的技术水平。

Comments Code: https://github.com/inventec-ai-center/DuoAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06128 2026-07-28 cs.CL 版本更新 57%

Parallel Tokenizers: Rethinking Encoder Models' Vocabulary Design in Cross-Lingual Transfer of Low-Resource Languages

并行分词器:重新思考低资源语言跨语言转移中编码器模型的词汇设计

Muhammad Dehan Al Kautsar, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 针对低资源语言跨语言转移中因词汇映射问题限制表示学习的情况,提出并行分词器框架,先单语训练再对齐词汇表,实验表明该方法训练的模型在多任务中优于传统基线,对推进多语言表示学习意义重大。

Comments 17 pages, 25 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22508 2026-07-27 cs.LG eess.SP 新提交 57%

Interpretable EEG biomarkers with bag-of-waves: Spatial and temporal waveform dictionaries for low-data regimes

基于波形包的可解释脑电生物标志物:低数据量情况下的时空波形字典

Athanasios Papastathopoulos-Katsaros, Steven T. Lee, Lin Yao, Ajay Thomas, Junseok Park, Matthew J. McGinley, Zhandong Liu

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 研究针对脑电分析难题,提出波形包框架,通过学习波形模板字典及扩展表示,在三个数据集上测试,能在低数据量下以少参数实现与先进模型竞争的性能,且具有完全可解释性。

Comments In Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22408 2026-07-27 cs.LG 新提交 57%

LunarFM: A Shared Multimodal Representation of the Moon's Surface

LunarFM:月球表面的共享多模态表示

Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-Pollán

机构 * University of Cambridge(剑桥大学) German Aerospace Center (DLR)(德国航空航天中心) SPAIDER SPACE(斯派德太空公司) Mines Paris - PSL University(巴黎矿业学院 - 巴黎文理研究大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) European Space Resources Innovation Center (ESRIC)(欧洲空间资源创新中心) Universidad de Antioquia(安蒂奥基亚大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 因月球探索需求,针对多源观测致月球表面分析碎片化问题,提出LunarFM多模态基础模型,融合多仪器观测学习通用表示,支持多种下游应用,还提供相关数据集、预训练模型等,助力月球表面高效分析。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22148 2026-07-27 cs.CV cs.AI 新提交 57%

dRAE: Representation Autoencoder with Hyper-Spherical Codes

dRAE:具有超球面码的表示自编码器

Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao, Tong Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Peking University(北京大学) Ant Group(蚂蚁集团)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究旨在解决高维视觉表示离散化难题,提出超球面量化(HSQ),其离散表示自编码器(dRAE)能解耦语义与特征幅度,防止码本坍缩,实现高保真重建,实验证明性能提升、码本利用率高且训练流程简化。

Comments Preprint. Project Page: https://drae-hsq.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22068 2026-07-27 cs.CV cs.LG 新提交 57%

Rethinking Multi-Branch and Cross-Backbone Fusion for Vehicle Re-Identification in the Foundation-Model Era

在基础模型时代重新思考用于车辆重识别的多分支和跨骨干融合

Yu Wang, Hongyu Yang

机构 * Huahuan (Yunnan) Technology Co., Ltd.(华环(云南)科技有限公司)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 研究在基础模型时代车辆重识别中多分支和跨骨干融合方法,以单个DINOv3预训练ConvNeXt为强基线,经无训练重排提升性能,通过实验评估增加表示多样性的效果,发现改进单骨干加检索重排比增加架构复杂度更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01145 2026-07-24 cs.LG eess.SP 版本更新 57%

Hierarchical Self-Supervised Representation Learning Framework for Multivariate Time Series Grounded in ECG Analysis

一种用于多变量时间序列的轻量级自监督学习框架:基于层次JEPA的心电图数据方法

Siwon Kim

机构 * Research Institute of Basic Sciences, Seoul National University(首尔大学基础科学研究院)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出ER-JEPA,一种轻量级自监督学习框架,通过层次化联合嵌入预测架构对多变量时间序列进行表征学习,在心电图数据上实现高效预训练和下游任务最优性能。

Comments 29 pages, 8 figures. Further clarified, added the new downstream task in the abstract and intro since last update.<< Polished text, improved formatting, fixed speed benchmark result, and added new downstream task. Code will be made publicly available soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19253 2026-07-22 cs.AI cs.CY cs.IR 新提交 57%

Sequential Learner Modeling Using Multi-Relational Graph Convolutional Networks

使用多关系图卷积网络的序列学习者建模

Rawaa Alatrash, Mohamed Amine Chatti, Hong Yang, Yumeng Wang

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 该研究针对用户建模问题,提出MR-ConceptGCN方法,结合个人知识图谱、多关系图卷积网络和预训练语言模型,构建序列学习者模型,通过在线用户研究验证了该方法在多个用户关注方面的优势。

Comments Paper submitted to IJAIED

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18816 2026-07-22 cs.DB cs.AI 新提交 57%

AgentTrails: Towards Trust and Reuse for Agentic Tasks

AgentTrails:迈向代理任务的信任与重用

Eden Wu, Sonia Castelo, Yurong Liu, Cláudio T. Silva, Juliana Freire

机构 * New York University(纽约大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 针对大语言模型驱动代理轨迹掩盖数据依赖限制开发人员理解等问题,提出AgentTrails系统,将原始轨迹转换为结构化溯源图,支持执行比较、模式提取等,能揭示隐藏依赖、对齐不同执行并展现重复工具使用模式。

Comments 4 pages, 4 figures. Short paper accepted at the Workshop on Systems for Data-centric Agents with Human-in-the-loop (DASHSys 2026), co-located with VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17712 2026-07-21 cs.AI 新提交 57%

Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution

学习检测跨模态否定:潜在表示分析与基于注意力的解决方案

Ali AbuSaleh, Leon Hammerla, Alexander Mehler

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究跨模态否定检测难题,提出新型跨模态注意力架构,分析发现文本与视觉否定的不对称性,结合自监督视频表示推进时间否定建模,为多模态系统学习语义对齐表示提供新方法。

Comments This manuscript is an accepted version of the article (published at ICNLP2026). Published in IEEE Xplore, DOI:10.1109/ICNLP69856.2026.11527861 document: https://ieeexplore.ieee.org/abstract/document/11527861

Journal ref 2026 8th International Conference on Natural Language Processing (ICNLP), Xi'an, China, 2026, pp. 613-622

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17272 2026-07-21 cs.LG cs.SI 新提交 57%

Node4All: Learning Node Representation Beyond Datasets

Node4All:超越数据集学习节点表示

Dooho Lee, Jaemin Yoo

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 研究针对多数节点表示学习方法依赖特定数据集训练的问题,提出Node4All,基于通道图变换器和自监督学习构建,能跨任意图数据集泛化,在节点分类任务中表现出色,实现可复用性且实践效果好。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16681 2026-07-21 cs.LG 新提交 57%

A Framework for Early Sepsis Prediction via Self-Supervised (JEPA) and Federated Representation Learning

一种通过自监督(JEPA)和联邦表示学习进行早期脓毒症预测的框架

Umair bin Mansoor, Munaf Rashid, Roomi Naqvi

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 研究针对电子健康记录中早期脓毒症预测面临的问题,比较了JEPA等四种建模范式及原始特征基线,最佳模型在发病时接近SupMix基准且减少生物标志物使用,一级管道有显著提升,微调后的VICReg编码器特征持久性最佳。

Comments 11 pages, 6 figures, Submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13597 2026-07-21 cs.RO cs.AI cs.CV 版本更新 57%

Semantic Anchoring for Robotic Action Representations

用于机器人动作表示的语义锚定

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

机构 * Peking University(北京大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究VLA模型微调后动作表示结构受损问题,受镜像神经元理论启发,通过系统探测证实结构变化与任务表现相关。提出即插即用方法,将动作表示锚定到语义流形并分解通道,经多基准测试验证,有效提升了模型在真实世界任务中的表现。

Comments Project Page: https://xy02-05.github.io/SemanticMN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15623 2026-07-20 stat.ML cs.LG 新提交 57%

Retraining Seeks Stable Signals

重新训练寻找稳定信号

Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究大规模预测模型性能表现现象下重新训练问题,提出稳定信号原理,证明存在稳定信号时经正则化的重复风险最小化会收敛到该信号方向,扩展分析范围并应用于语言建模数据反馈回路。

Comments Companion article to an invited contribution to the Proceedings of the International Congress of Mathematicians (ICM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04419 2026-07-20 cs.AI 版本更新 57%

Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces

智能体步骤值:使用基于状态的语言模型评估器进行状态转换测量

Andrew Zhang, Chengzhan Li

机构 * KTH Royal Institute of Technology(皇家理工学院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 研究提出智能体步骤值(ASV)框架,通过状态转换测量评估智能体动作,能定位最终答案分数等遗漏的关键信息,还介绍了具体方法及工具,并用实验验证其有效性。

Comments adds source-contract intervention and two-wave retry study; re-acquires cube and extends bridge cohort to n=98 to 100

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14536 2026-07-17 cs.LG 新提交 57%

Muse: Representation Geometry of Muon Beyond Normalized Momentum

缪子:超越归一化动量的μ子表示几何

Da Chang, Qiankun Shi, Lvgang Zhang, Di He, Yaoshuai Ma, Ganzhao Yuan, Yongxiang Liu

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) Shenzhen University of Advanced Technology(深圳先进技术大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 研究μ子风格优化器中表示选择对优化器几何的影响,引入{\方法}族优化器,通过预训练实验及固定动量诊断发现平衡非原生表示可匹配原生表示性能,减小较短维度会改变优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14280 2026-07-17 cs.RO cs.LG 新提交 57%

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

DiMaS:用于引导视觉-语言-动作模型的分布匹配

Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

机构 * ISIR, Sorbonne Université(法国国家信息与自动化研究所,索邦大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究针对基于流匹配的视觉-语言-动作模型细粒度行为控制不足的问题,提出DiMaS分布匹配引导策略,能有效控制行为,研究其泛化性并分析原因,推动了视觉运动设置下的分布匹配设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14250 2026-07-17 cs.CL 新提交 57%

The Severance Problem: LLMs are Unaware of the Person Beyond the Prompt

分离问题:大语言模型未意识到提示之外的人

Dor Litvak, Liu Leqi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 研究指出个人AI助手存在不良行为,源于语言模型的“分离问题”。提出通过“分离模式”将结构化无知纳入语言模型上下文的解决方案,经实证,五个模型家族采用此模式后能减少不良行为,模型在信息缺失时会询问澄清问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13899 2026-07-16 cs.AI 新提交 57%

AIMO Interpretability Challenge

AIMO可解释性挑战

Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp

机构 * National Institute of Informatics(日本国立信息学研究所) Munich Center for Machine Learning / MaiNLP LMU(慕尼黑机器学习中心/慕尼黑大学语言与文学计算研究所) University of Tübingen(图宾根大学) Fuzhou University(福州大学) Masaryk University(马萨里克大学) University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出AIMO可解释性挑战,基于前沿数学语言模型内部机制区分稳健与虚假推理。利用AIMO问题等资源,提供推理问题、模型访问及鲁棒性评估,助参与者开发识别稳健模型的方法,创建新基准和基线系统,连接可解释性与泛化研究。

Comments Accepted Competition at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13047 2026-07-16 cs.LG 新提交 57%

Targeted Recovery of Weight-Space Mechanisms From Neural Networks

从神经网络中定向恢复权重空间机制

Antoine Vigouroux, Lee Sharkey

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究提出定向参数分解(tPD)方法,通过引入高秩通用组件,从神经网络中仅识别处理特定感兴趣输入的组件,在玩具模型和Transformer语言模型上验证有效,能以低计算量提取子模型并对记忆序列进行手术式操作。

Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12474 2026-07-16 cs.AI 版本更新 57%

From Observation to Insight: Mechanistic World Models and the Quest for Autonomous Discovery

从观察到洞察:机制世界模型与自主发现探索

Ingmar Posner, Anson Lei, Bernhard Schölkopf

机构 * MPI for Intelligent Systems & ELLIS Institute(马克斯·普朗克智能系统研究所及埃利斯研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本文探讨科学发现问题,提出机制世界模型这一新设计范式,将可重复使用机制置于核心,推导其计算能力、设计原则等,指出虽有不同研究方向捕捉该范式要素但缺统一框架,为推动AI走向自主科学发现提供基础和蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏