arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 626 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 626 篇

2606.09148 2026-06-09 cs.CL 新提交 57%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20969 2026-08-24 cs.CV 新提交 50%

Kinematic Knowledge Maps for Pattern Alignment: Structured Latent Representational Learning in Multimodal Gait Analysis

用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习

Chen Dong, He Zonglin, Cheung Kenneth M.C

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20682 2026-08-24 cs.CV 新提交 50%

Aristotelian Manifolds: Leveraging Platonic Perceptual Features for Backpropagation Free Rapid Concept Learning

亚里士多德流形:利用柏拉图式感知特征实现无反向传播的快速概念学习

Michael Karnes, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出基于柏拉图式表征假说的亚里士多德流形框架,将基础模型作为通用感知滤波器,研究不同领域的几何响应特征,建立层选择与特征压缩分类体系,实现无反向传播的基础模型潜在空间利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18994 2026-08-20 cs.HC 新提交 50%

TractorBeam: Personalized AI Sensemaking Support via Collaborative Machine Annotation

TractorBeam:通过协作机器标注实现个性化AI意义建构支持

Sireesh Gururaja, Jordan Taylor, Emma Strubell

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本研究提出TractorBeam浏览器扩展系统,通过协作机器标注隐喻解决语言模型文档问答系统的事实性与来源性问题,初步用户研究显示其可支持用户迭代优化模型输出并促进探索性意义建构。

Comments UIST Poster Extended Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17553 2026-08-19 cs.RO 新提交 50%

Scalix: Uncertainty-Aware Scale-Consistent Monocular SLAM

Scalix:感知不确定性的尺度一致单目SLAM

Sebastian Barbas Laina, Tianyi Zhang, Panagiotis Petropoulakis, Simon Schaefer, Simon Boche, Jaehyung Jung, Cedric Le Gentil, Stefan Leutenegger

机构 * University of Technology, Sydney(悉尼科技大学) Centre for Autonomous Systems(自主系统中心)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出实时单目SLAM框架Scalix,通过整合带不确定性的学习深度线索到概率因子图,实现度量尺度估计,在多环境基准上性能领先且实时泛化。

Comments 8 pages, 5 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16669 2026-08-18 cs.CV 新提交 50%

Concept-based explanation of gene expression prediction from H&E images

基于概念的H&E图像基因表达预测解释

Amos Muench, Jonathan Thielmann, Reduan Achtibat, Maximilian Dreyer, Philip Bischoff, Caroline Forsythe, Hamidreza Parand, Thomas Walter, David Horst, Sebastian Lapuschkin, Wojciech Samek, Teresa Gabriela Krieger

机构 * Institute of Pathology – Charité Universitätsmedizin(夏里特医学院病理学研究所) Fraunhofer Heinrich-Hertz-Institute(弗劳恩霍夫海因里希·赫兹研究所) Center for Computational Biology (CBIO), Mines Paris, PSL University(巴黎矿业学院计算生物学中心(巴黎文理研究大学)) Institut Curie, PSL University(居里研究所(巴黎文理研究大学)) German Cancer Research Center (DKFZ)(德国癌症研究中心) Technological University Dublin(都柏林理工大学) Technische Universität Berlin(柏林工业大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本研究提出结合相关性传播与概念发现的可解释ViT框架,用于从H&E图像预测空间转录组学,可关联分子表型与组织形态,能准确预测结直肠癌相关ST特征并分层患者结局。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16110 2026-08-18 cs.CV 新提交 50%

SUGFW+: An Uncertainty-guided Feature Weighting Framework for Cold Start Active Adaptation of SAM in Medical Image Segmentation

SUGFW+: 一种用于医学图像分割中SAM的冷启动主动适应的不确定性引导特征加权框架

Xiaochuan Ma, Ning Zhu, Jia Fu, Lanfeng Zhong, Hanyu Jiang, Bin Song, Kang Li, Guotai Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Glassgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对医学图像分割中SAM冷启动主动适应的样本选择问题,提出SUGFW+框架,集成SAM的PFUC、PGDR模块与GSCU策略及UPFT过程,在四个公共数据集上取得CSAL任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14428 2026-08-17 cs.CV 新提交 50%

GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure

GhostPoint:通过幻觉生成被遮挡的激光雷达结构实现自监督表示学习

Mohamed Abdelsamad, Bin Yang, Michael Ulrich, Miao Zhang, Yakov Miron, Alexandru Paul Condurache, Abhinav Valada

机构 * Bosch Center for AI(博世人工智能中心) University of Freiburg(弗莱堡大学) University of Luebeck(吕贝克大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 GhostPoint是一种自监督学习框架,通过实例体素膨胀幻觉生成激光雷达被遮挡区域特征,在nuScenes和Waymo数据集上提升了下游3D检测性能,尤其适用于稀疏扫描和有限标签场景。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13556 2026-08-14 cs.CV 新提交 50%

V-RAE: Rethinking Video Latent Spaces for Generation

V-RAE:重新思考用于生成的视频隐空间

Minghui Guo, Shengqiong Wu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本研究提出V-RAE视频表示自动编码器,基于冻结视觉基础模型构建生成隐空间,在多项视频任务上优于现有模型,还引入tFVD指标,证明冻结语义表示可支持多种视频建模任务。

Comments 26 pages, 8 tables, 13 figures, project page: https://v-rae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10659 2026-08-12 cs.SD 新提交 50%

DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

DINO-A:将自蒸馏视觉Transformer适配至通用音频表示学习

Tomasz Radzikowski, Mateusz Modrzejewski, Przemysław Rokita

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本研究提出DINO-A,将自蒸馏视觉Transformer适配至通用音频表示学习,通过替换输入模态和增强方式实现,在多音频数据集上验证了其性能,发现了补丁分辨率、骨干选择对任务的影响及与BYOL-A v2的性能差异原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交 50%

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03410 2026-08-05 cs.CV 新提交 50%

Earth Embeddings

地球嵌入

Adam J. Stewart, Heng Fang, Isaac A. Corley, Xiao Xiang Zhu

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 该研究介绍地球嵌入的类型、特性与应用场景,通过案例展示其实用工作流程,为嵌入的选择等提供指导,并探讨相关开放问题,助力地球观测领域的高效分析。

Comments book chapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 50%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28993 2026-08-03 cs.RO cs.CV 新提交 50%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 该研究针对视觉分布偏移下机器人操作的鲁棒性问题,提出ST-WAM模型,采用DINOv3等技术,在多个基准测试中取得优异性能,大幅提升了偏移场景下的零样本操作表现。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26913 2026-07-30 cs.CV 新提交 50%

Prior Directions: Why GUI Grounding Gets Locked in the Past

先验方向:为什么GUI grounding会被锁定在过去

Weile Gong, Zijian Lu, Mingcai Chen, Yiping Zuo, Xin He, Weibei Fan

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 该研究探究视觉-语言模型的GUI grounding锁定问题,提出先验方向概念,发现其是锁定的关键,移除该方向分量可恢复视觉grounding。

Comments 13 pages, 8 figures. Code: https://github.com/phare111/prior-directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24872 2026-07-29 cs.IT cs.SY eess.SY math.IT 新提交 50%

Beam-Response Contrastive Learning for Transmitter-Side MIMO CSI Representation

用于发射机端MIMO CSI表示的波束响应对比学习

Sehyun Ryu, Yumin Kim, Minjae Lee, Hyun Jong Yang, John M. Cioffi

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究无标签信道状态信息的自监督表示学习,提出波束响应对比学习框架BRCL,基于发射端Gram矩阵,结合重建学习实现样本级CSI恢复和波束响应级一致性,实验表明其提高标签效率且性能优于其他预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14521 2026-07-17 cs.CV 新提交 50%

Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition

Uni-AdaVD:通过正交值分解实现视觉生成的通用概念擦除

Qifan Zhou, Yuan Wang, Yanbin Hao, Xiang Wang, Kuien Liu, Richang Hong, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 针对视觉生成模型吸收不良概念问题,提出Uni-AdaVD框架,将多模态注意力值空间作为干预空间,结合正交值分解与自适应擦除移位抑制目标语义方向,实验证明其在单多概念擦除且保留非目标先验方面性能强大,为视觉生成模型提供安全机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14442 2026-07-17 cs.CR 新提交 50%

Disclosure Divergence: Measuring Privacy Policy and Data Safety Misalignment at Scale

披露差异:大规模衡量隐私政策与数据安全的不一致性

Mst Eshita Khatun, Lamine Noureddine, Sideeq Bello, Aisha Ali-Gombe

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 针对移动应用隐私政策与数据安全标签表述不一致问题,通过对6051款安卓应用大规模实证研究,利用基于大语言模型的框架和统一模式,测量一致性并引入风险评分,发现敏感类别受影响大,凸显披露机制差距,强调加强验证与提高透明度。

Journal ref Proceedings on Privacy Enhancing Technologies (PoPETs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13192 2026-07-16 cs.CV 新提交 50%

Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?

自监督视觉表征学习:预训练-微调还是联合训练?

Nusrat Munia, Tyler Ward, Nishat Nayla, Matthew A. Massey, Abdullah-Al-Zubaer Imran

机构 * University of Kentucky(肯塔基大学) Kentucky Geological Survey(肯塔基地质调查局)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究自监督视觉表征学习中预训练-微调与联合训练两种范式,通过在多种任务及不同标记数据比例下评估性能,发现JT在低标记时提高效率且稳健,PFT在专业领域更可靠,为混合自监督半监督学习提供基准和指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12098 2026-07-15 cs.IR 新提交 50%

Explaining When PRF Fails: Participatory Auditing for Selective Query Expansion

解释伪相关反馈何时失败:用于选择性查询扩展的参与式审计

Zeyan Liang, Graham McDonald, Iadh Ounis

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 研究PRF失败问题,提出两阶段审计然后自动化框架,第一阶段通过对用户审计揭示PRF利弊,第二阶段利用基于语言模型的重排器作预测器,解释PRF危害及决策过程,使检索组件可审计且以用户为基础。

Comments Accepted at WExIR @ SIGIR 2026, the 2nd Workshop on Explainability in Information Retrieval, Melbourne (Naarm), Australia, 24 July 2026. 3 pages, 1 figure. Extended abstract building on the SIGIR 2026 short paper "Auditing Query Drift: Do Users Actually Benefit from Pseudo-Relevance Feedback?" (doi:10.1145/3805712.3809916)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12050 2026-07-15 cs.RO 新提交 50%

EFLUX: Elastic Multi-Robot Formation Navigation and Adaptation with Agentic LLMs

EFLUX:基于智能语言模型的弹性多机器人编队导航与自适应

Jinyuan Zhang, Yuwei Wu, Guangyao Shi, Jonathan Diller, Gaurav S. Sukhatme, Vijay Kumar

机构 * GRASP Lab, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 针对多机器人在受限环境中编队导航问题,提出EFLUX框架,基于几何和大语言模型,对变形与重新配置动作联合推理,经闭环管道转化为航点,实验证明其能实现安全弹性导航,减少死锁与导航失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11281 2026-07-14 cs.CV 新提交 50%

The Devil Is in the Leakage: A Disentangled Dual-Purification Framework for High-Fidelity Hairstyle Transfer

问题出在泄漏中:用于高保真发型转移的解缠双净化框架

Jijie Li, Jiankuo Zhao, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(中国科学院大学 模式识别国家重点实验室) MAIS, CASIA(中国科学院自动化所 模式识别国家重点实验室) CAIR, HKSIS, CAS(中国科学院香港创新研究院 计算机与信息工程实验室) SCSE, FIE, M.U.S.T(澳门科技大学 资讯科技学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 研究发型转移中参考发型与源身份纠缠及现有方法泄漏问题,提出双净化框架,含对抗发型净化和对比几何净化两个正则化器,实现高保真、身份保留的发型转移并达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11196 2026-07-14 cs.CV 新提交 50%

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders

Slot-RAE:通过直接表示自动编码器简化以对象为中心的学习

Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * LIRIS(里昂图像与信息系统实验室) Ecole Centrale de Lyon(里昂中央理工学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 研究针对以对象为中心的模型部署问题,提出Slot-RAE框架,直接在视觉基础模型特征空间运行,采用特征空间扩散过程及独特训练方式,在COCO数据集实验中取得领先成果,实现高效无监督对象发现等,速度和计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11118 2026-07-14 cs.CV 新提交 50%

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

GHOST:不透明表面纹理的几何引导幻觉

Langxu Zhao, Zuan Gu, Tianhan Gao

机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10003 2026-07-14 cs.SD 新提交 50%

ARIMA: Reconstruction-Grounded Predictive Representation Learning for Symbolic Music

ARIMA:用于符号音乐的基于重构的预测表示学习

Mingyang Yao, Zhaoxiang Feng

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出ARIMA框架,用于符号音乐的基于重构的预测表示学习。它直接从数据学习紧凑窗口表示,编码窗口为潜在表示,训练因果预测器并通过结构化重构确定编码器基础,在多下游任务表现良好,证明相关方法的有效性和重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09583 2026-07-13 cs.CV 新提交 50%

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

从上方进行可提示的概念分割:评估SAM 3在遥感中的零样本和单样本能力

Mohammad Dabaja, Turgay Celik

机构 * University of Agder(阿格德大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 研究在严格零样本和单样本约束下,对SAM 3在遥感场景分类等任务中的能力进行评估。核心方法是对SAM 3结构调整并隔离提示模态来诊断对齐机制,还制定代理评估协议。主要贡献是揭示跨模态干扰,表明SAM 3避免过拟合但受分辨率等限制,指明微调方向。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09143 2026-07-13 cs.CV 新提交 50%

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

编织光与时间:用于密集RGB-事件解析的统一谐波-几何表示学习

Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li

机构 * NKIARI(鹏城实验室) VCIP, CS, Nankai University(南开大学视觉计算与图像处理研究室) AAIS, Nankai University(南开大学人工智能学院)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究针对RGB-事件解析中统一主干应用的挑战,提出Evita统一主干,嵌入几何视差校正等协同学习模块,构建N-ImageNetV2及预训练协议,经多基准评估,其实现新指标,在实时多模态上精度-延迟权衡表现卓越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06424 2026-07-08 cs.CV 新提交 50%

XRFormer: Multiscale Tokenization for XRF Representation Learning

XRFormer:用于X射线荧光光谱表示学习的多尺度令牌化

Sofiane Daimellah, Sylvie Le Hégarat-Mascle, Clotilde Boust

机构 * Centre de Recherche et de Restauration des Musées de France(法国国家博物馆研究与修复中心)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究针对X射线荧光光谱自动学习难的问题,提出XRFormer架构,通过多尺度卷积令牌器定制,结合自监督预训练方法,在颜料识别和分解任务中表现出色,凸显多尺度令牌化在数据有限时对基于变压器的XRF建模的有效性和高效性。

Comments International Conference on Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06356 2026-07-08 eess.IV cs.CV 新提交 50%

TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring

TMF-RSE:用于肺部严重程度评分的具有区域语义和证据不确定性的三模态融合

Fadi Abdeladhim Zidi, Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Gaby Maroun, Fadi Dornaika, Cosimo Distante

机构 * Institute of Applied Sciences and Intelligent Systems (ISASI), CNR(应用科学与智能系统研究所(ISASI),CNR) Department of Computer Science and Artificial Intelligence, University of the Basque Country (UPV/EHU)(巴斯克国家大学计算机科学与人工智能系) University of Salento(萨莱nton大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 针对从胸部影像量化肺部疾病严重程度的问题,提出TMF-RSE框架,结合多模态特征,采用互补融合机制和证据回归,在相关数据集实验中性能优于基于Transformer的基线。

Comments 6 pages, 2 figures, 5 tables. IEEE conference format (IEEEtran). Submitted to AVSS 2026. Tri-modal fusion for lung severity scoring using appearance, segmentation, and VLM semantics with evidential uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05373 2026-07-07 cs.CV 新提交 50%

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

PixWorld:在像素空间中统一3D场景生成与重建

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian

机构 * Nanyang Technological University(南洋理工大学) AISphere(人工智能领域)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对3D场景生成与重建原有范式存在信息损失等缺陷,提出像素空间统一扩散框架PixWorld,引入几何感知损失,无需预训练自编码器,性能优于现有方法。

Comments Project page: https://sensengao.github.io/PixWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏