arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 250 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 250 篇

2608.07902 2026-08-11 cs.CY cs.AI cs.HC 新提交 57%

Beyond "I Can't Help With That": How Child Safety Experts Evaluate AI Chatbot Safety

超越“我无法对此提供帮助”:儿童安全专家如何评估AI聊天机器人的安全性

Hannah Cha, Neha Shukla, Solon Barocas, Alexandra Chouldechova, Eugenia Kim, Jennifer Wortman Vaughan

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文通过访谈19名儿童安全相关从业者,分析现有AI聊天机器人儿童安全评估的局限,提出需将从业者视角纳入安全评估工作的建议。

Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06202 2026-08-07 cs.HC cs.AI 新提交 57%

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

当前AI基准测试未测量的内容:模态、搜索、引用及其对安全评估的启示

Ro Encarnación, Tina Behzad, Emma Lurie, Danaé Metaxa

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 该研究发现AI基准测试未涵盖模态、搜索等关键因素,以ChatGPT为例对比两种模态及搜索条件,发现这些因素会影响模型准确率、一致性等,主张AI安全评估需纳入这些维度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交 57%

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04289 2026-08-06 cs.AI cs.CL 新提交 57%

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act

SafeCommit:验证基于记忆的智能体何时可以安全行动

Mayur Akewar, Ravi Ranjan

机构 * Florida International University(佛罗里达国际大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对长程智能体过早承诺的问题,提出SafeCommit风险控制层,通过构建合理潜在世界、共形动作证书等实现安全行动决策,还展示了安全-效用权衡。

Comments 14 pages, 6 tables, and 1 figure, target NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04286 2026-08-06 cs.CL cs.LG 新提交 57%

Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks

通过语义等价对抗攻击引出大语言模型的内在幻觉

Atri Vivek Sharma, Brian Formento, Alessio Lomuscio

机构 * Imperial College London(帝国理工学院) Safe Intelligence(安全智能研究院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出新框架,通过语义等价对抗攻击测试LLMs鲁棒性,发现先进模型易受语义保留扰动影响致忠实度大幅下降,凸显需开发鲁棒接地的LLM架构与训练目标。

Comments To be presented at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03782 2026-08-05 cs.AI 新提交 57%

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

KnowHal:用于全面多模态幻觉评估的知识驱动基准

Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLMs)的幻觉评估缺口,提出知识驱动的KnowHal基准,涵盖四个幻觉维度,经评估发现知识维度是模型最大挑战,多数模型对错误前提鲁棒性有限。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02621 2026-08-05 cs.CL cs.AI 新提交 57%

Knowing the Form, Not the Function: Automatically Auditing Answer--Authority Decoupling in Legal Benchmarks

知晓形式,而非功能:自动审计法律基准中答案与权威的脱钩问题

Hsien-Jyh Liao

机构 * Ministry of Justice, Taiwan(台湾法务部)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文针对法律基准中答案与权威脱钩问题,联合审计四款LLMs在台湾律师考试题上的表现,发现答案与引用行为可独立变化,提出答案与权威联合评估的方法。

Comments 9 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00068 2026-08-04 cs.CV 新提交 57%

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准

Yi Cui, Zilin Wang, Yijie Xu, Qianyi Cai, Huizai Yao, Shuai Jiang, Bingzhuo Zhong, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。

Comments Accepted by KDD 2026. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28641 2026-08-03 cs.CL cs.AI 新提交 57%

The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Social Load?

形式主义陷阱:社会负荷下作为评判者的大语言模型是否会被共识模仿蒙蔽?

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 该研究提出Agentic形式主义陷阱与评估失调指数,通过多领域轨迹分析揭示作为评判者的大语言模型易受句法触发影响,且该漏洞与领域无关,需架构特定的警戒过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28573 2026-07-31 cs.AI 新提交 57%

Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

重新思考本地计算机使用智能体的推理时扩展:失败模式与计算权衡

Woongkyu Lee, Jungwook Choi

机构 * Hanyang University(汉阳大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文针对本地计算机使用智能体的推理时扩展开展系统实证研究,评估多款模型在OSWorld基准上的表现,揭示其边际收益递减、失败模式转变等规律,提出高效本地智能体的设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28532 2026-07-31 cs.CV 新提交 57%

MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition

MarkushGlyph与OCSRGlyph:改进的化学结构识别

Alex Andonian, Samuel G Rodriques, Andrew D White, Siddharth M Narayanan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本研究将化学结构识别视为图像到文本转换任务,提出OCSRGlyph与MarkushGlyph模型,前者优化OCSR性能,后者针对Markush结构采用整体视觉语言建模,还提出新指标解决Markush结构翻译的准确性判定问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28226 2026-07-31 cs.CR cs.AI 新提交 57%

Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation

基于世界模型的具身智能安全性:威胁、防御与评估的生命周期

Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25152 2026-07-29 cs.AI 新提交 57%

When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops

智能体循环何时会将停滞误认为进步?长期运行的自主语言模型智能体循环中的自我评估偏差与外部基础验证

Hyundoo Park, Byungho Choi

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究长期运行的自主智能体循环中自我评估偏差导致的“进步幻觉”问题,通过构建测试平台,控制评估者信息通道类型,发现自我报告无意义,带内评判者也有偏差,指出开放式目标需带外评估,强调评估者依据对结果的重要性。

Comments 23 pages. Preregistered pilot measurement study. Also deposited on Zenodo (concept DOI 10.5281/zenodo.21594735)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24194 2026-07-28 cs.CV 新提交 57%

Face Age Verification Vulnerabilities Under Simple Appearance Manipulations

简单外观操纵下的面部年龄验证漏洞

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, Centre for Research and Technology Hellas(信息技术研究所,希腊研究与技术中心)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究简单外观操纵下面部年龄验证的漏洞,评估七个模型在三个数据集及四种操纵类型下的情况,发现胡茬操纵影响大,不同人口统计特征受影响有差异,还探索了用偏差缓解方法减轻偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23537 2026-07-28 cs.AI 新提交 57%

ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness

ObsDriveBench:具有可观测性意识的恶劣天气下多模态理解基准测试

Qiao Yan, Yihan Wang, Zhenghao Xing, Jiaqi Xu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 研究恶劣天气下视觉语言模型在多模态输入时的表现,引入ObsDriveBench基准测试,通过可观测性元标注等构建含多类问题的测试集,实验发现现有模型性能降,还引入ObsDrive模型提升其在多方面的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21582 2026-07-24 cs.RO cs.CV 新提交 57%

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

战略扩展:通过偏差感知评估和数据收集学习机器人操作中的组合泛化

Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) NVIDIA(英伟达)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 研究机器人操作中组合泛化问题,通过引入诊断框架量化指令因素偏差,提出偏差感知数据收集策略,能定位预训练策略捷径问题,实现更高效可泛化的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21022 2026-07-24 cs.CV 新提交 57%

ProCap: Prominence-guided Object Rectification for Faithful and Comprehensive Video Captioning

ProCap:用于忠实和全面视频字幕的突出引导对象校正

Debjyoti Das Adhikary, Aritra Hazra, Partha Pratim Chakrabarti

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校计算机科学与工程系)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对视频字幕质量提升问题,提出突出感知的迭代事后校正框架。通过轻量级评分机制排序对象,经提示驱动细化循环多轮注入相关对象。在多数据集验证,相比基线提升完整性、减少幻觉,提供了轻量级且模型无关的视频字幕优化途径。

Comments 10 pages, 7 figures, 5 tables. Submitted to IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 57%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17883 2026-07-21 cs.CL cs.AI 新提交 57%

Zero Hallucination, by Construction: Hallucination-Aware Layered Oversight for Trustworthy Enterprise AI

通过构建实现零幻觉:用于可信企业人工智能的幻觉感知分层监督

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究企业AI因幻觉难以被信任的问题时,提出HALO架构,通过六层防御将幻觉视为可控制故障模式,详细介绍各层并关注基于证据的置信度,以实现可信企业AI,在索赔提取工作负载上进行了架构说明。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16726 2026-07-21 cs.CV 新提交 57%

Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs

专家能否在无训练情况下适应?关于多模态视觉语言模型的测试时模态泛化

Raza Imam, Darakshan Rashid, Yutong Xie, Dwarikanath Mahapatra, Brejesh Lall, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Khalifa University(哈里发大学) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 研究医学视觉语言模型测试时模态泛化问题,提出MoBE框架,通过熵引导动态路由与专家级贝叶斯适应相结合,无需参数更新,在多基准测试中比现有方法平均准确率有显著提升,实现无训练专家适应以增强模态泛化。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14256 2026-07-17 cs.AI cs.MA 新提交 57%

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

基于多级智能数据管理的自动硬示例合成

Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan, Nichole J. Hansen, Blaž Bratanič, Nathan L Clement, Shalini Ghosh, Ariel Fuxman

机构 * UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。

Comments 23 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13038 2026-07-16 cs.CY cs.AI 新提交 57%

Designing Safety-Constrained LLM Systems for Public Health Information Access

设计用于公共卫生信息访问的安全约束大语言模型系统

Ben Torkian, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对公共卫生信息访问,尤其是母婴健康资源导航,设计实现安全约束大语言模型系统。采用多层架构,含领域受限RAG等,通过可控数据管道确保回复基于精选资源。经场景验证,系统安全约束执行一致、性能稳定,为相关领域部署LLM系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11228 2026-07-14 cs.CY cs.AI 新提交 57%

DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs

深度偏差:对大型视觉语言模型中社会偏差的自适应深度探测

Anqi Li, Jie Zhang, Zhongqi Wang, Songkai Xue, Jiahao Wang, Shiguang Shan, Xilin Chen

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 研究大型视觉语言模型中社会偏差问题,提出DeepBias自适应框架,通过“生成-演化-探测”循环及智能体深度探测偏差,构建DeepBiasBench基准,实验证明其有效性,为LVLM安全评估建立进化范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 57%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 57%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07663 2026-07-09 cs.AI 新提交 57%

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

人工智能中的递归自我改进:从有界自我优化到自主研究循环

Mingguang Chen, Licheng Wang, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) AlphaAvatar(阿尔法阿凡达) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究人工智能系统自身改进,通过对1250篇论文调查区分有界自我优化与开放式递归自我改进(RSI),考察评估器设计空间并排序信号,发现自我改进强度与层次相关,失败模式源于违规,指出治理级测量是薄弱环节。

Comments 42 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 57%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06649 2026-07-09 cs.CR cs.LG 新提交 57%

POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking

POPS:通过提示优化参数抖动恢复多模态大语言模型中未学习的多模态知识

Zhangheng LI, Jianing Zhu, Junyuan Hong, Sungmin Eum, Shuowen Hu, Suya You, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 研究针对多模态大语言模型中隐私敏感信息擦除不彻底问题,提出POPS对抗策略,通过提示后缀优化生成潜在私人示例并微调模型,实验揭示现有MMU算法弱点,POPS能近乎完全恢复敏感信息,暴露隐私保护漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01657 2026-07-03 cs.CV 新提交 57%

Domain Generalization via Text-Anchored Information Bottleneck

基于文本锚定信息瓶颈的域泛化

Eunyi Lyou, Yunjeong Choi, Junho Lee, Joonseok Lee

机构 * Seoul National University(首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出通过语言嵌入空间作为信息瓶颈来抑制视觉表征中的虚假线索,从而提升域泛化性能,实验表明该方法达到最新最优水平。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01457 2026-07-03 cs.CL cs.AI 新提交 57%

Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting

接地优化:一种减少自动个人文档重写中LLM幻觉的分层工程框架

Shashank Indukuri, Adarsh Agrawal

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出五层接地优化框架,通过时间验证、污染检测、结构不变性、提示接地和评估器,将简历重写中的幻觉率降至0.04-0.24。

Comments 13 pages, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/grounded-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏