arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7596 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7596 篇

1206.5698 2013-06-21 cs.AI 57%

Relational Approach to Knowledge Engineering for POMDP-based Assistance Systems as a Translation of a Psychological Model

Marek Grzes, Jesse Hoey, Shehroz Khan, Alex Mihailidis, Stephen Czarnuch, Dan Jackson, Andrew Monk

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1301.3888 2013-01-18 cs.AI 57%

Probabilistic State-Dependent Grammars for Plan Recognition

David V. Pynadath, Michael P. Wellman

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

Comments Appears in Proceedings of the Sixteenth Conference on Uncertainty in Artificial Intelligence (UAI2000)

详情

展开后加载摘要…

URL PDF HTML 收藏
1206.6845 2012-07-02 stat.ME cs.LG stat.ML 57%

Gibbs Sampling for (Coupled) Infinite Mixture Models in the Stick Breaking Representation

Ian Porteous, Alexander T. Ihler, Padhraic Smyth, Max Welling

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

Comments Appears in Proceedings of the Twenty-Second Conference on Uncertainty in Artificial Intelligence (UAI2006)

详情

展开后加载摘要…

URL PDF HTML 收藏
1206.6392 2012-07-02 cs.LG cs.SD stat.ML 57%

Modeling Temporal Dependencies in High-Dimensional Sequences: Application to Polyphonic Music Generation and Transcription

Nicolas Boulanger-Lewandowski, Yoshua Bengio, Pascal Vincent

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

Comments Appears in Proceedings of the 29th International Conference on Machine Learning (ICML 2012)

详情

展开后加载摘要…

URL PDF HTML 收藏
0808.0973 2009-12-01 cs.AI cs.IR 57%

Text Modeling using Unsupervised Topic Models and Concept Hierarchies

Chaitanya Chemudugunta, Padhraic Smyth, Mark Steyvers

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
cmp-lg/9805009 2009-11-30 cmp-lg cs.CL 57%

Discovery of Linguistic Relations Using Lexical Attraction

Deniz Yuret

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

Comments dissertation, 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
cmp-lg/9612005 2009-11-30 cmp-lg cs.CL 57%

Maximum Entropy Modeling Toolkit

Eric Sven Ristad

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

Comments 32 pages, texinfo format

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25902 2026-04-29 cs.CL cs.AI cs.LG 56%

Toward a Functional Geometric Algebra for Natural Language Semantics

迈向自然语言语义的函数几何代数

James Pustejovsky

机构 * Computer Science Department(计算机科学系)

专题命中 知识编辑与模型理解 :分类 cs.CL、cs.AI、cs.LG;language model(comments)

AI总结 本文提出函数几何代数框架,利用克莱因代数提升语义表示的结构组织性,解决传统线性代数在组合语义、类型敏感性和可解释性上的局限。

Comments 43 pages. Keywords: geometric algebra, Clifford algebra, compositional semantics, natural language semantics, type coercion, multivector representations, graded type system, Generative Lexicon, neural language models, distributional semantics

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01858 2024-04-19 cs.LG cs.AI cs.CL cs.CV 56%

Explaining latent representations of generative models with large multimodal models

Mengdan Zhu, Zhenke Liu, Bo Pan, Abhinav Angirekula, Liang Zhao

专题命中 知识编辑与模型理解 :分类 cs.CL、cs.AI、cs.LG;foundation model(comments)

Comments ICLR 2024 Workshop on Reliable and Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23728 2026-08-26 cs.CV 新提交 50%

Velocity-coupled Representation Refinement for Satellite Orbit Prediction

用于卫星轨道预测的速度耦合表示精化

Yue Yang, Zhiqiang Wu, Saiyu Qi, Fan Ma

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 该研究针对现有卫星轨道预测方法未利用位置与速度耦合关系的问题,提出OrbitNet方法,通过速度耦合表示精化和轨道片段建模,在Starlink域内及6个星座零样本评估中均优于对比模型。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18994 2026-08-26 cs.HC 版本更新 50%

TractorBeam: Personalized AI Sensemaking Support via Collaborative Machine Annotation

TractorBeam:通过协作机器标注实现个性化AI意义建构支持

Sireesh Gururaja, Jordan Taylor, Emma Strubell

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本研究提出TractorBeam浏览器扩展系统,通过协作机器标注隐喻解决语言模型文档问答系统的事实性与来源性问题,初步用户研究显示其可支持用户迭代优化模型输出并促进探索性意义建构。

Comments UIST Poster Extended Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21476 2026-08-25 cs.SE cs.CV 新提交 50%

From Subjective Judgments to Auditable Standards:Protocol-Guided AI Auditing of Website Redundancy

从主观判断到可审计标准:协议引导的网站冗余度AI审计

Ge Kong, Yongtong Cao

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出CORA审计方法,通过多维度测量分离网站冗余的不同含义,在测试台上表现优于基线,对不达标工具弃权自动评分,是受控基准的可审计候选程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08590 2026-08-25 cs.CV 版本更新 50%

PRISM: Streaming Human Motion Generation with Per-Joint Latent Decomposition

PRISM:基于关节潜在分解的流式人类动作生成

Zeyu Ling, Qing Shuai, Teng Zhang, Shiyang Li, Bo Han, Changqing Zou

机构 * State Key Laboratory of CAD & CG(CAD与计算机图形学国家重点实验室) Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) Computer Animation & Perception Group(计算机动画与感知小组)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 PRISM通过关节潜在分解和无噪声条件注入,实现了流式人类动作生成,统一了文本到动作、姿态条件生成等多种任务,达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20969 2026-08-24 cs.CV 新提交 50%

Kinematic Knowledge Maps for Pattern Alignment: Structured Latent Representational Learning in Multimodal Gait Analysis

用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习

Chen Dong, He Zonglin, Cheung Kenneth M. C

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20682 2026-08-24 cs.CV 新提交 50%

Aristotelian Manifolds: Leveraging Platonic Perceptual Features for Backpropagation Free Rapid Concept Learning

亚里士多德流形:利用柏拉图式感知特征实现无反向传播的快速概念学习

Michael Karnes, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出基于柏拉图式表征假说的亚里士多德流形框架,将基础模型作为通用感知滤波器,研究不同领域的几何响应特征,建立层选择与特征压缩分类体系,实现无反向传播的基础模型潜在空间利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-24 cs.CV cs.IR 版本更新 50%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Chunyi Peng, Zhipeng Xu, Yukun Yan, Zhenghao Liu, Shi Yu, Sen Mei, Yubo Sun, Yongheng Zhang, Jie Zhou, Yu Gu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17553 2026-08-19 cs.RO 新提交 50%

Scalix: Uncertainty-Aware Scale-Consistent Monocular SLAM

Scalix:感知不确定性的尺度一致单目SLAM

Sebastian Barbas Laina, Tianyi Zhang, Panagiotis Petropoulakis, Simon Schaefer, Simon Boche, Jaehyung Jung, Cedric Le Gentil, Stefan Leutenegger

机构 * University of Technology, Sydney(悉尼科技大学) Centre for Autonomous Systems(自主系统中心)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出实时单目SLAM框架Scalix,通过整合带不确定性的学习深度线索到概率因子图,实现度量尺度估计,在多环境基准上性能领先且实时泛化。

Comments 8 pages, 5 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16669 2026-08-18 cs.CV 新提交 50%

Concept-based explanation of gene expression prediction from H&E images

基于概念的H&E图像基因表达预测解释

Amos Muench, Jonathan Thielmann, Reduan Achtibat, Maximilian Dreyer, Philip Bischoff, Caroline Forsythe, Hamidreza Parand, Thomas Walter, David Horst, Sebastian Lapuschkin, Wojciech Samek, Teresa Gabriela Krieger

机构 * Institute of Pathology – Charité Universitätsmedizin(夏里特医学院病理学研究所) Fraunhofer Heinrich-Hertz-Institute(弗劳恩霍夫海因里希·赫兹研究所) Center for Computational Biology (CBIO), Mines Paris, PSL University(巴黎矿业学院计算生物学中心(巴黎文理研究大学)) Institut Curie, PSL University(居里研究所(巴黎文理研究大学)) German Cancer Research Center (DKFZ)(德国癌症研究中心) Technological University Dublin(都柏林理工大学) Technische Universität Berlin(柏林工业大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本研究提出结合相关性传播与概念发现的可解释ViT框架,用于从H&E图像预测空间转录组学,可关联分子表型与组织形态,能准确预测结直肠癌相关ST特征并分层患者结局。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16110 2026-08-18 cs.CV 新提交 50%

SUGFW+: An Uncertainty-guided Feature Weighting Framework for Cold Start Active Adaptation of SAM in Medical Image Segmentation

SUGFW+: 一种用于医学图像分割中SAM的冷启动主动适应的不确定性引导特征加权框架

Xiaochuan Ma, Ning Zhu, Jia Fu, Lanfeng Zhong, Hanyu Jiang, Bin Song, Kang Li, Guotai Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Glassgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对医学图像分割中SAM冷启动主动适应的样本选择问题,提出SUGFW+框架,集成SAM的PFUC、PGDR模块与GSCU策略及UPFT过程,在四个公共数据集上取得CSAL任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14428 2026-08-17 cs.CV 新提交 50%

GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure

GhostPoint:通过幻觉生成被遮挡的激光雷达结构实现自监督表示学习

Mohamed Abdelsamad, Bin Yang, Michael Ulrich, Miao Zhang, Yakov Miron, Alexandru Paul Condurache, Abhinav Valada

机构 * Bosch Center for AI(博世人工智能中心) University of Freiburg(弗莱堡大学) University of Luebeck(吕贝克大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 GhostPoint是一种自监督学习框架,通过实例体素膨胀幻觉生成激光雷达被遮挡区域特征,在nuScenes和Waymo数据集上提升了下游3D检测性能,尤其适用于稀疏扫描和有限标签场景。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13556 2026-08-14 cs.CV 新提交 50%

V-RAE: Rethinking Video Latent Spaces for Generation

V-RAE:重新思考用于生成的视频隐空间

Minghui Guo, Shengqiong Wu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本研究提出V-RAE视频表示自动编码器,基于冻结视觉基础模型构建生成隐空间,在多项视频任务上优于现有模型,还引入tFVD指标,证明冻结语义表示可支持多种视频建模任务。

Comments 26 pages, 8 tables, 13 figures, project page: https://v-rae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09045 2026-08-14 cs.CV 50%

Scene-Agnostic Object-Centric Representation Learning for 3D Gaussian Splatting

面向3D高斯散射的场景无关物体感知表示学习

Tsuheng Hsu, Guiyu Liu, Juho Kannala, Janne Heikkilä

机构 * Aalto University(阿尔托大学) University of Oulu(奥卢大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出一种场景无关的物体感知监督方案,通过预训练的slot attention基Global Object Centric Learning模块,学习一致的物体代码本,提升3DGS的表示结构和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10659 2026-08-12 cs.SD 新提交 50%

DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

DINO-A:将自蒸馏视觉Transformer适配至通用音频表示学习

Tomasz Radzikowski, Mateusz Modrzejewski, Przemysław Rokita

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本研究提出DINO-A,将自蒸馏视觉Transformer适配至通用音频表示学习,通过替换输入模态和增强方式实现,在多音频数据集上验证了其性能,发现了补丁分辨率、骨干选择对任务的影响及与BYOL-A v2的性能差异原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交 50%

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11402 2026-08-07 cs.CV 版本更新 50%

SCD4VPR: Multi-modal Scene Change Detection for Long-term Visual Place Recognition Database Update

基于视觉-语言表示学习的场景变化检测

Diwei Sheng, Vijayraj Gohil, Satyam Gaba, Zihan Liu, Giles Hamilton-Fletcher, John-Ross Rizzo, Yongqing Liang, Chen Feng

机构 * New York University(纽约大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出LangSCD框架,通过融合语言和视觉信息提升场景变化检测的鲁棒性,引入几何-语义匹配模块和多类标注数据集NYC-CD,实验证明其在多个基准上的优越性能。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03410 2026-08-05 cs.CV 新提交 50%

Earth Embeddings

地球嵌入

Adam J. Stewart, Heng Fang, Isaac A. Corley, Xiao Xiang Zhu

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 该研究介绍地球嵌入的类型、特性与应用场景,通过案例展示其实用工作流程,为嵌入的选择等提供指导,并探讨相关开放问题,助力地球观测领域的高效分析。

Comments book chapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 50%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08575 2026-08-04 cs.RO 版本更新 50%

FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty

FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型

Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

专题命中 知识编辑与模型理解 :post-training(abstract)

AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15587 2026-08-04 physics.optics 50%

High-speed optical microscopy for neural voltage imaging: Methods, trade-offs, and opportunities

高速光学显微镜用于神经电压成像:方法、权衡与机遇

Zhaoqiang Wang, Ruth R. Sims, Sheng Xiao, Ruixuan Zhao, Ohr Benshlomo, Zihan Zang, Jiamin Wu, Valentina Emiliani, Liang Gao

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 本文探讨了高速光学显微镜在神经电压成像中的方法、技术权衡及应用前景,总结了最新进展与潜在影响。

Journal ref Wang, Z., Sims, R.R., Xiao, S. et al. Methods, trade-offs and opportunities in high-speed optical microscopy for neural voltage imaging. Nat. Photon. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28993 2026-08-03 cs.RO cs.CV 新提交 50%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 该研究针对视觉分布偏移下机器人操作的鲁棒性问题,提出ST-WAM模型,采用DINOv3等技术,在多个基准测试中取得优异性能,大幅提升了偏移场景下的零样本操作表现。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏