arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-03 至 2026-03-03 共收录 163 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 43 篇

2603.00267 2026-03-03 cs.AI cs.IR cs.SI 57%

Multi-Sourced, Multi-Agent Evidence Retrieval for Fact-Checking

多源多智能体证据检索用于事实核查

Shuzhi Gong, Richard O. Sinnott, Jianzhong Qi, Cecile Paris, Preslav Nakov, Zhuohan Xie

机构 * The University of Melbourne(墨尔本大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 WKGFC通过多智能体证据检索和知识图谱增强,提升事实核查的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17050 2026-03-03 cs.CV 57%

Geodesic Prototype Matching via Diffusion Maps for Interpretable Fine-Grained Recognition

通过扩散映射的测地原型匹配用于可解释的细粒度识别

Junhao Jia, Yunyou Liu, Yifei Sun, Huangwei Chen, Feiwei Qin, Changmiao Wang, Yong Peng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出通过扩散映射的测地原型匹配方法,用于可解释的细粒度识别,通过内在几何结构提升原型的语义对应性。

Comments The paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10067 2026-03-03 cs.CV 57%

FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization

FiLo++: 通过融合细粒度描述和变形定位实现零/少样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) School of Artifcial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Wuhan AI Research(武汉AI研究所) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Intellectual Property & Big Data, Guangdong Polytechnic Normal University(广东省知识产权与大数据重点实验室,广东工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 FiLo++通过融合细粒度描述和变形定位技术,提升零/少样本异常检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00156 2026-03-03 cs.CV 57%

BiCLIP: Bidirectional and Consistent Language-Image Processing for Robust Medical Image Segmentation

BiCLIP: 用于鲁棒医学图像分割的双向和一致语言-图像处理

Saivan Talaei, Fatemeh Daneshfar, Abdulhady Abas Abdullah, Mustaqeem Khan

机构 * Department of Computer Engineering, University of Kurdistan, Iran(伊朗库尔德大学计算机工程系) Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(伊拉克埃尔比尔库尔德大学人工智能与创新中心) College of Information Technology, United Arab Emirates University, UAE(阿联酋大学信息科技学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 BiCLIP通过双向多模态融合和一致性目标提升医学图像分割的鲁棒性,有效应对标注稀少和临床伪影挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00098 2026-03-03 stat.OT cs.CY cs.LG econ.GN math.PR q-fin.EC 57%

Profiling vs. Case-specific Evidence: A Probabilistic Analysis

案件 profiling 与个案证据:一种概率分析

Marcello Di Bello, Nicolò Cangiotti, Michele Loi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文通过概率分析探讨了 profiling 证据与个案证据的区别,指出 profiling 证据不能直接证明被告具体罪行,挑战了其在刑事审判中的有效性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02146 2026-03-03 cs.CL 50%

LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards

长上下文强化学习需要可验证的上下文奖励

Guanzheng Chen, Michael Qizhe Shieh, Lidong Bing

机构 * National University of Singapore(国立新加坡大学) MiroMind AI absolute AI

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LongRLVR通过引入可验证的上下文奖励,解决长上下文强化学习中因稀疏奖励导致的梯度消失问题,显著提升大语言模型的推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16017 2026-03-03 cs.GT 50%

Hidden-Role Games: Equilibrium Concepts and Computation

隐性角色游戏:均衡概念与计算

Luca Carminati, Brian Hu Zhang, Gabriele Farina, Nicola Gatti, Tuomas Sandholm

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出隐性角色游戏的均衡定义,揭示其计算复杂性,并通过实验验证了在大规模实例中的计算可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01460 2026-03-03 cs.SE 50%

Production-Grade AI Coding System for Client-Side Development

面向客户端开发的生产级AI编码系统

Ruihan Wang, Chencheng Guo, Guangjing Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种面向客户端开发的生产级AI编码系统,通过结构化多阶段流程整合Figma设计、PRD和领域知识,提升代码生成与产品需求的对齐性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00725 2026-03-03 cs.CL 50%

LaSTR: Language-Driven Time-Series Segment Retrieval

LaSTR:基于语言的时间序列片段检索

Kota Dohi, Harsh Purohit, Tomoya Nishida, Takashi Endo, Yusuke Ohtsubo, Koichiro Yawata, Koki Takeshita, Tatsuya Sasaki, Yohei Kawaguchi

机构 * Research(研究) Development Group, Hitachi, Ltd.(日立有限公司研发小组)

专题命中 视觉定位与Grounding :VLM(abstract)

AI总结 LaSTR通过结合语言描述和时间序列数据,实现了高效的时间序列片段检索,提升了检索质量和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00612 2026-03-03 cs.CL 50%

From Literature to Hypotheses: An AI Co-Scientist System for Biomarker-Guided Drug Combination Hypothesis Generation

从文献到假设:一种用于生物标志物引导的药物组合假设生成的AI合作者系统

Raneen Younis, Suvinava Basak, Lukas Chavez, Zahra Ahmadi

机构 * Peter L. Reichertz Institute for Medical Informatics (PLRI), Hannover Medical School(汉诺威医学院彼得·L·里赫茨医学信息学研究所) Lower Saxony Center for Artificial Intelligence and Causal Methods in Medicine (CAIMed)(下萨克森医学人工智能与因果方法中心) Sanford Burnham Prebys (SBP) Medical Discovery Institute, San Diego(圣地亚哥桑福尔德·伯恩斯医学发现研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出 AI 合作者系统 CoDHy,通过整合生物医学知识图谱和文献证据,实现基于生物标志物的药物组合假设生成与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 4 篇

2603.00510 2026-03-03 cs.CV cs.AI 84%

What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models

视觉标记究竟编码了什么?揭示多模态大语言模型中的稀疏性与冗余性

Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 文档图表理解 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究揭示多模态大语言模型中视觉标记的稀疏性与冗余性,通过EmbedLens工具发现活跃标记在进入模型前已编码细粒度信息,并提出中层注入方法提升效率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01840 2026-03-03 cs.CV eess.IV 70%

FireRed-OCR Technical Report

FireRed-OCR 技术报告

Hao Wu, Haoran Lou, Xinyue Li, Zuodong Zhong, Zhaojun Sun, Phellon Chen, Xuanhe Zhou, Kai Zuo, Yibo Chen, Xu Tang, Yao Hu, Boxiang Zhou, Jian Wu, Yongji Wu, Wenxin Yu, Yingmiao Liu, Yuhao Huang, Manjie Xu, Gang Liu, Yidong Ma, Zhichao Sun, Changhao Qiao

机构 * Super Intelligence Team(超级智能团队) Xiaohongshu Inc(小红书公司)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 FireRed-OCR 通过三阶段渐进训练策略,将通用 VLM 转化为高精度结构文档解析专家,实现 OCR 领域的突破性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22373 2026-03-03 cs.CL cs.AI cs.CV 62%

VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations

VisJudge-Bench: 可视化美学与质量评估

Yupeng Xie, Zhiyang Zhang, Yifan Wu, Sirong Lu, Jiayi Zhang, Zhaoyang Yu, Jinlin Wang, Sirui Hong, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DeepWisdom(深智科技) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VisJudge-Bench提出首个可视化质量评估基准,通过VisJudge模型显著提升对可视化美学和质量的判断精度。

Comments 62 pages, 27 figures, 8 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00476 2026-03-03 cs.CR cs.AI 57%

Atomicity for Agents: Exposing, Exploiting, and Mitigating TOCTOU Vulnerabilities in Browser-Use Agents

代理的原子性:揭示、利用和缓解浏览器使用代理中的TOCTOU漏洞

Linxi Jiang, Zhijie Liu, Haotian Luo, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI

AI总结 本文研究了浏览器使用代理中的TOCTOU漏洞,通过实证研究揭示其普遍存在性,并提出基于预执行验证的轻量级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 8 篇

2411.03292 2026-03-03 cs.SE cs.AI cs.HC 83%

Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping

Interaction2Code: 基于MLLM的交互式网页代码生成基准测试

Jingyu Xiao, Yuxuan Wan, Yintong Huo, Zixin Wang, Xinyi Xu, Wenxuan Wang, Zhiyao Xu, Yuhang Wang, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Singapore Management University, Singapore(新加坡管理学院) Renmin University of China, China(中国人民大学) Tsinghua University, China(清华大学) Southwest University, China(西南大学)

专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Interaction2Code提出首个基于MLLM的交互式网页代码生成基准测试,识别MLLM在交互生成中的四个限制并提出四种增强策略。

Comments Published in the Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01813 2026-03-03 cs.RO 67%

SSMG-Nav: Enhancing Lifelong Object Navigation with Semantic Skeleton Memory Graph

SSMG-Nav: 通过语义骨架记忆图增强终身物体导航

Haochen Niu, Lantao Zhang, Xingwu Ji, Rendong Ying, Peilin Liu, Fei Wen

机构 * Brain-Inspired Application Technology Center (BATC), Shanghai Jiao Tong University(脑启发应用技术中心(BATC),上海交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 SSMG-Nav通过语义骨架记忆图提升终身物体导航,整合多模态信息与持久记忆,优化路径效率与任务成功率。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00926 2026-03-03 cs.RO 67%

DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation

DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作

Xiongfeng Peng, Jiaqian Yu, Dingzhe Li, Yixiang Jin, Lu Xu, Yamin Mao, Chao Zhang, Weiming Li, Sujin Jang, Dongwook Lee, Daehyun Ji

机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) Samsung AI Center, DS Division(三星人工智能中心,DS部门) Hanyang University ERICA(翰洋大学ERICA)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-03-03 cs.CV cs.AI cs.LG 67%

Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10045 2026-03-03 cs.RO cs.AI cs.LG 62%

Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning

神经符号技能发现用于条件多级规划

Hakan Aktas, Yigit Yildirim, Ahmet Firat Gamsiz, Deniz Bilge Akkoc, Erhan Oztop, Emre Ugur

机构 * Department of Computer Science and Technology The University of Cambridge(计算机科学与技术系 剑桥大学) Department of Computer Engineering Bogazici University(计算机工程系 boazici大学) SISREC Osaka University(Osaka大学SISREC)

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种神经符号学习架构,通过少量演示获取可推广的高级符号技能,并在多级规划中实现复杂任务的执行。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02035 2026-03-03 cs.RO cs.CV 57%

LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers

LAD-Drive: 通过动作感知扩散变换器弥合语言与轨迹

Fabian Schmidt, Karol Fedurko, Markus Enzweiler, Abhinav Valada

机构 * Institute for Intelligent Systems, Esslingen University of Applied Sciences(智能系统研究所,埃斯林根应用科学大学) Department of Computer Science, University of Freiburg(计算机科学系,弗赖堡大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 LAD-Drive通过动作感知扩散变换器,将语言模型的意图与连续轨迹生成结合,提升自动驾驶中的多模态规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00590 2026-03-03 cs.AI 57%

Fair in Mind, Fair in Action? A Synchronous Benchmark for Understanding and Generation in UMLLMs

公平在心,公平在行?一个用于理解与生成的同步基准:UMLLMs的公平性评估

Yiran Zhao, Lu Zhou, Xiaogang Xu, Zhe Liu, Jiafei Wu, Liming Fang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 IRIS基准通过同步评估UMLLMs的理解与生成任务公平性,揭示系统性偏见现象并提供公平性优化指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00503 2026-03-03 cs.CV 57%

M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval

M$^2$: 通过轨迹摘要和洞察检索实现长 horizon 网络代理的双记忆增强

Dawei Yan, Haokui Zhang, Guangda Huzhang, Yang Li, Yibo Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Ying Li, Wei Dong, Chunhua Shen

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学) AI Business, Alibaba Group, Hangzhou, China(阿里云人工智能业务) Xi'an University of Architecture(西安建筑科技大学) Zhejiang University, Hangzhou, China(浙江大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 M$^2$通过双记忆机制提升长 horizon 网络代理的上下文效率和决策鲁棒性,实现更高成功率和更低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 9 篇

2509.23465 2026-03-03 cs.AI 79%

ViTSP: A Vision Language Models Guided Framework for Solving Large-Scale Traveling Salesman Problems

ViTSP:一种由视觉语言模型引导的解决大规模旅行商问题的框架

Zhuoli Yin, Yi Ding, Reem Khir, Hua Cai

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.AI

AI总结 ViTSP利用预训练视觉语言模型指导大规模TSP求解,通过识别子问题提升全局解的质量,实验表明其在大规模实例上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01694 2026-03-03 cs.CV cs.AI cs.LG 75%

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

MVR:多视图视频奖励塑造用于强化学习

Lirui Luo, Guoxi Zhang, Hongming Xu, Yaodong Yang, Cong Fang, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01950 2026-03-03 cs.LG cs.CL cs.CV 73%

Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment

语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训

Christopher Driggers-Ellis, Nachiketh Tibrewal, Rohit Bogulla, Harsh Khanna, Sangpil Youm, Christan Grant, Bonnie Dorr

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。

Comments 8 pages, 2 figures, 3 tables. Includes link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20095 2026-03-03 cs.CV cs.CL cs.LG 62%

BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models

BioCAP: 利用合成描述性注释超越标签在生物基础模型中的应用

Ziheng Zhang, Xinyue Ma, Arpita Chowdhury, Elizabeth G. Campolongo, Matthew J. Thompson, Net Zhang, Samuel Stevens, Hilmar Lapp, Tanya Berger-Wolf, Yu Su, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Duke University(杜克大学) Boston University(波士顿大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 BioCAP通过生成合成描述性注释提升生物基础模型的性能,实现物种分类和文本-图像检索的高准确率。

Comments ICLR 2026; Project page: https://imageomics.github.io/biocap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00529 2026-03-03 cs.CV cs.AI 62%

CaptionFool: Universal Image Captioning Model Attacks

CaptionFool: 针对最新Transformer图像描述模型的通用图像描述模型攻击

Swapnil Parekh

机构 * Intuit

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CaptionFool通过修改少量图像块,成功生成任意目标描述,揭示了视觉-语言模型的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01625 2026-03-03 cs.CL cs.AI 57%

Measuring What VLMs Don't Say: Validation Metrics Hide Clinical Terminology Erasure in Radiology Report Generation

衡量VLMs不表达的内容:验证指标隐藏了放射学报告生成中的临床术语擦除

Aditya Parikh, Aasa Feragen, Sneha Das, Stella Frank

机构 * DTU Compute, Technical University of Denmark(丹麦技术大学计算机学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出临床关联位移(CAD)和加权关联擦除(WAE)指标,用于评估放射学报告生成中临床术语的保留情况,揭示当前验证指标在临床术语擦除方面的不足。

Comments This is an extended version of a manuscript currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01603 2026-03-03 cs.CV 57%

Sparse View Distractor-Free Gaussian Splatting

稀疏视角无干扰高斯点云法

Yi Gu, Zhaorui Wang, Jiahang Cao, Jiaxu Wang, Mingle Zhao, Dongjun Ye, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Macau(澳门大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种基于先验信息的框架,用于提升稀疏视角下无干扰3DGS的性能,通过几何模型和视觉-语言模型增强训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-03-03 cs.SI 50%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏