arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-24 至 2026-08-24 共收录 73 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 29 篇

2608.21067 2026-08-24 cs.CV cs.AI 新提交 62%

AT-ViT: Area-Targeted Multi-View Vision Transformer with Cross-Attention and Multi-Scale Patching for Plant Trait Recognition in Herbarium Images

AT-ViT:面向标本馆图像植物性状识别的区域定向多视图视觉Transformer,融合交叉注意力与多尺度分块技术

Amani Sedrat, Takieddine Chehhat, Youcef Sklab, Hanane Ariouat, Abderrazak Sebaa, Eric Chenin, Jean-Daniel Zucker, Edi Profiti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对标本馆图像植物性状识别的背景干扰问题,提出双分支视觉Transformer模型AT-ViT,通过交叉注意力与掩码引导分块加权机制提升植物区域注意力,在多任务中实现准确率与鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20690 2026-08-24 cs.CV cs.AI 新提交 62%

Identity-Aware Human-Object Interaction Motion Captioning

身份感知的人-物交互动作描述

Yiming Wang, Yonghao Dang, Huilai Li, Jiawei Tu, Jianqin Yin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对现有HOI动作描述未关联主体身份的局限,提出身份感知HOI动作描述任务,构建ID-HOINet模型,含MVIML与TSCR组件,在BEHAVE和InterCap数据集上实现SOTA性能。

Comments 9 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20607 2026-08-24 cs.CL cs.AI cs.LG 新提交 62%

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification

JuryProbe:用于将无参考事实性评判小组路由至基于事实的验证的经验共识风险诊断方法

Tianxin Zhou, Ruixi Lin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对无参考事实性LLM评判小组的共识风险诊断方法JuryProbe,通过校准路由策略减少假阴性盲区导致的错误,在FEVER数据上验证了其有效性,可降低假接受并减少参考获取。

Comments 22 pages, 1 figure, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21230 2026-08-24 cs.CR cs.AI 新提交 57%

Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking

受攻击下的效用:智能体记忆投毒及内容筛选与来源排序的局限性

Arulnidhi Karunanidhi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对智能体记忆投毒问题,测试了内容筛选和来源排序的防御效果,发现仅内容筛选无法抵御投毒,来源加权检索也存在局限,主张采用有限占用约束并发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20754 2026-08-24 cs.CV 新提交 57%

SPARK-SAM: Self-Prompt Adaptation with Response Knowledge for SAM in Infrared Small Target Segmentation

SPARK-SAM:面向红外小目标分割SAM的、基于响应知识的自提示适配

Aji Mao, Zhenming Peng, Bailin Mu, Tian Pu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对SAM直接迁移至红外小目标分割存在的提示-响应不匹配问题,提出SPARK-SAM方法,仅增0.726M参数即实现高IoU,在两个基准上排名第一。

Comments 9 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20713 2026-08-24 cs.CV 新提交 57%

AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation

AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集

Xiangfei Sheng, Weidong Zou, Tianjiao Gu, Zhichao Yang, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。

Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20393 2026-08-24 cs.CL cs.AI 新提交 57%

Knowledge-Graph-Gated Defactualization for Style-Controllable and Fact-Preserving Generation in Agentic Conversational AI

面向智能体对话AI的风格可控且事实保留生成的知识图谱门控去事实化方法

Tanmay Kumar Shrivastava, Darsh Rohit Nandu, Rajesh Kumar Mundotiya

机构 * Indian Institute of Technology (IIT) Bhilai(印度比莱印度理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对智能体对话AI的事实保留与风格可控生成需求,提出DSR知识工程框架,结合KG与激活引导,在LLaMA系列模型上验证其可提升实体恢复率并保持风格控制,无需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11238 2026-08-24 cs.AI 版本更新 57%

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

面向查询不可知的RAG评估:基于查询覆盖率与声明可验证性

Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Q-CARE框架,通过分解查询与答案实现RAG的细粒度评估,在8个数据集的基准测试中,其评估结果与人工判断的相关性优于现有4种RAG评估指标。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13988 2026-08-24 cs.AI 版本更新 57%

Recognizing Artificial Minds: A Philosophical Defense of AI Cognition

识别人工心智:对AI认知的哲学辩护

Herman Cappelen, Josh Dever

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究为“全猪论题”辩护,主张LLMs是具备认知状态的成熟智能体,反驳相关质疑并推测其可能拥有人类概念体系外的内容。

Comments Pre-publication draft. Forthcoming as Open Access from Oxford University Press. Please cite the OUP version when available. Note title change: previously, "Going Whole Hog: A Philosophical Defence of AI Cognition"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20412 2026-08-24 q-bio.GN 新提交 50%

PEN-STACK: A non-fabricating tool layer for language-model agents in genome writing

PEN-STACK:用于基因组写作的语言模型智能体的非制造工具层

Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出PEN-STACK工具层,为基因组写作的语言模型智能体提供可靠来源的工具,可消除数量伪造,经测试能提升生物安全,为智能体基因组工程系统提供了开源基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21035 2026-08-24 cs.RO 新提交 50%

TaPeR: Probabilistic Recovery of Sparse Task Precedence Graphs from a Handful of Demonstrations

TaPeR:从少量演示中概率恢复稀疏任务优先关系图

Adrian Röfer, Karla Stepanova, Abhinav Valada

机构 * University of Freiburg(弗莱堡大学) Czech Technical University(捷克技术大学) Czech Institute of Informatics, Robotics, and Cybernetics(捷克信息学、机器人学与控制论研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 TaPeR方法仅用运动学图和物体位姿分布,从少量演示中恢复更准确的稀疏任务优先关系图,可生成机器人的多种有效执行顺序。

Comments 8 pages, 5 figures, 3 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20356 2026-08-24 cs.DB 新提交 50%

Disentangling Structure and Semantics: How Schema Representation Affects LLM-Based SQL Generation

解耦结构与语义:模式表示如何影响基于大语言模型(LLM)的SQL生成

Daniel Yitian Su, Sophie Yiran Su, Qiang Sun, Yihao Ding, Wei Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过6×3析因实验发现,基于LLM的文本转SQL中,语义线索对性能的影响大于结构线索,有意义的标识符可弥补结构缺失,而丰富结构元数据无法改善名称不明确的情况。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19056 2026-08-24 math.AT 版本更新 50%

Relative Obstructions and Spectral Diagnostics for Sheaves on Cell Complexes

相对障碍与谱诊断:关于细胞复形上sheaves的分析

Shinobu Yokoyama

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于sheaf理论和谱分析的框架,用于评估结构不一致的相对障碍,通过谱特征识别不一致的性质和位置。

Comments 8 pages. Presented at the Finland-Japan Workshop in Industrial and Applied Mathematics 2026. v3: Substantially revised and corrected. Previous claims on spectral interleavings and cone reduction are removed. The cone-kernel statement is recast via the standard mapping-cone long exact sequence, and the paper is reframed as a methodological and computational application

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22194 2026-08-24 math.OC 版本更新 50%

Stability Analysis of an Integrated Multistage Stochastic Programming and Markov Decision Process Problem

一个集成多阶段随机规划与马尔可夫决策过程问题的稳定性分析

Zhiyao Yang, Zhiping Chen, Huifu Xu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究集成MSP-MDP框架下的动态决策过程,通过推导动态嵌套重构、函数性质及误差界来研究内、外生不确定性概率分布扰动下的稳定性,结果与现有不同,为相关模型提供新理论基础。

Comments 68 pages, revised manuscript with corrections and clarifications to the model formulation, theoretical analysis, proofs, and examples

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-08-24 cs.DB cs.DS cs.IR 版本更新 50%

jXBW: A Compressed Index Enabling Structure-Aware JSONL Retrieval for Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 3 篇

2608.20868 2026-08-24 cs.CV cs.CL 新提交 77%

Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images

识别、定位、关联:从文档图像中进行端到端键值提取

A. Said Gurbuz (1 and 2), Ahmed Nassar (1), Christoph Auer (1), Maksym Lysak (1), Lucas Morin (1), Matteo Omenetti (1), Tim Strohmeyer (1), Panagiotis Vagenas (1), Nikolaos Livathinos (1), Michele Dolfi (1), Peter Staar (1) ((1) IBM Research Zurich, (2) ETH Zurich)

机构 * IBM Research Zurich(IBM苏黎世研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对传统文档处理的误差传播问题,微调SmolDocling模型实现端到端键值提取,在多个数据集上性能优于更大基线模型,且体积小、推理快。

Comments Accepted at ICDAR 2026. 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20932 2026-08-24 cs.CV 新提交 57%

OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank

OccluRank:仅添加序数秩的可控遮挡感知布局到图像生成

Wenyang Hong, Yuan Wang, Yanbin Hao, Lanqing Xue, Ke Wang, Xiang Wang, Kuien Liu, Richang Hong

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出OccluRank框架,仅添加序数秩实现可控遮挡感知布局到图像生成,构建相关数据集与基准,实验表明其能可靠保留实例、遵循布局并实现期望遮挡关系,性能相当。

Comments 16 pages, 7 figures. Code: this https URL (https://github.com/Wenyang-hong/OccluRank)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-24 cs.CV cs.IR 版本更新 57%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Chunyi Peng, Zhipeng Xu, Yukun Yan, Zhenghao Liu, Shi Yu, Sen Mei, Yubo Sun, Yongheng Zhang, Jie Zhou, Yu Gu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 7 篇

2608.20975 2026-08-24 cs.AI 新提交 83%

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

无行为的信念:测量视觉-语言模型中心智理论到协同社会行动的转化

Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf

机构 * CIAMS, Université Paris-Saclay(巴黎萨克雷大学 CIAMS) CQSB, Sorbonne Université(索邦大学 CQSB)

专题命中 GUI与屏幕智能体 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出基准MOSAIC评估视觉-语言模型的心智理论到协同社会行动的转化,发现多数模型存在瓶颈,而带显式ToM模块的PCM-LLM表现优异,证实显式信念-行动耦合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20797 2026-08-24 cs.AI 新提交 81%

Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

基于步骤级结果推理与聚合的移动智能体自动轨迹评估

Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng

机构 * Jiutian Research(九天研究院) China Mobile(中国移动)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20763 2026-08-24 cs.CV cs.AI 新提交 81%

CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models

CARD:诊断视觉语言模型中从信念到行动的路由故障

Souptik Kumar Majumdar, Fabian Kögel, Andreas Bulling

机构 * Universität Stuttgart(斯图加特大学)

专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出跨轴路由诊断(CARD)方法,在新型协作网格世界基准Relay Chain上诊断发现视觉语言模型(VLMs)存在未将信念表征纳入下一次行动预测的关键路由故障,相关成果为改进VLMs的信念-行动路由提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20707 2026-08-24 cs.IR 新提交 67%

Towards Faithful Simulation of Human Shopping Behavior

面向人类购物行为的忠实模拟

Jiakai Tang, Yan Mi, Jing Yu, Yang Zhang, See-Kiong Ng, Qi Cao, Fei Sun, Xu Chen, Wen Chen, Jian Wu, Han Zhu, Bo Zheng

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21247 2026-08-24 cs.CV cs.RO 新提交 57%

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

视觉-语言-动作模型中用于令牌压缩的刚可察觉差异建模

Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Bytedance Inc.(字节跳动公司) Shandong University(山东大学) CNRS(法国国家科学研究中心) CentraleSupelec(中央理工学院) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文针对视觉-语言-动作模型的令牌压缩问题,提出Action-JND方法,通过动作容忍度准则优化压缩,在LIBERO基准实验中提升了激进压缩下的压缩可靠性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-24 cs.HC cs.AI 版本更新 57%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21355 2026-08-24 cs.RO 新提交 50%

ViTacPhys: Physical Property-Aware Grasping from Human Visual-Tactile Demonstrations

ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法

Yiwen Liu, Yujun Zhu, Kui Jia, Zhao Liao, Yangwei You, Shuaijun Wang

机构 * Xiaomi Robotics(小米机器人)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。

Comments 11 pages, 7 figures. Project page: this https URL (https://vitacphys.github.io/ViTacPhys/)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 5 篇

2608.21100 2026-08-24 cs.AI 新提交 87%

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

ReFrame:多模态大语言模型中基于证据的测试时安全对齐

Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对现有多模态安全对齐方法不适用于闭源模型的问题,提出无需训练的ReFrame框架,通过两个智能体协作实现测试时安全对齐,在提升安全性能的同时保留多模态效用。

Comments Accepted to EMNLP 2026. 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20810 2026-08-24 cs.MM cs.AI cs.CV cs.GR 新提交 73%

When Generated Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Yangchen Zeng, Haoyu Wang, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-24 cs.CV cs.SC 版本更新 57%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Withdrawn by the authors due to premature submission before final review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13400 2026-08-24 cs.CV 版本更新 57%

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

文本是什么颜色?:一个用于评估图像嵌入提示引发幻觉的基准

Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(软件学院、人工智能研究院、北航、北京、中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, Beijing, China(未来区块链与隐私计算先进创新中心、北航、北京、中国)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出Embedded Stroop范式,构建WCIT基准评估MLLMs的图像嵌入提示幻觉,发现语义可读性可主导其视觉颜色感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-08-24 cs.SI 版本更新 50%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏