arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-18 至 2026-08-18 共收录 115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 40 篇

2608.15238 2026-08-18 cs.CV 新提交 90%

UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models

UC-VLM:基于一致性驱动学习的视觉语言大模型生成图像检测方法

Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.CV

AI总结 UC-VLM是仅依赖二元监督的多阶段框架,通过复用真实性标签实现视觉适配与文本生成,在GenImage、Chameleon等数据集上显著提升了AI生成图像检测的准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16004 2026-08-18 cs.IR 新提交 89%

LineageRAG: Harnessing GraphRAG by Constructing Evidence Lineages with Source Grounding

LineageRAG:通过构建带源 grounding 的证据谱系来利用 GraphRAG

Linyao Zheng, Xuhang Shi, Zhifang Mao, Sai Zhou, Shuaixian An, Xiuquan Hou, Jinze Li

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 LineageRAG 针对现有 GraphRAG 未明确证据发现与源 grounding 关联的问题,构建带源 grounding 的证据谱系,在三个多跳问答数据集上较基线实现多项指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-18 cs.AI cs.RO 新提交 87%

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15061 2026-08-18 cs.CV 新提交 87%

Do Visual Grounding Decoders Need Feed-Forward Networks? A Controlled Study over Frozen Vision-Language Features

视觉定位解码器是否需要前馈网络?基于冻结的视觉-语言特征的受控研究

Tarun Tomar

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究通过受控实验对比不同视觉定位解码器,发现仅注意力的4块解码器(A4)性能与含FFN的4块解码器相当,8块仅注意力解码器(A8)可弥补A4的微小差距且更优,同时A4能减少参数量与延迟。

Comments 14 pages, 8 figures, 5 tables. Code and project page: https://github.com/TarunTomar122/attention-is-all-you-need-for-vlms

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-18 cs.CV 版本更新 84%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14724 2026-08-18 cs.CV cs.AI cs.LG 新提交 83%

Privacy-Preserving Dataset Curation for Kuala Lumpur Urban Traffic: Grounded Vision-Language Detection with Spatial Vehicle-Context Filtering

面向吉隆坡城市交通的隐私保护数据集构建:结合空间车辆上下文过滤的接地视觉-语言检测

Mohammed Abdul Al Arafat Tanzin, Rudzidatul Akmam Dziyauddin

机构 * Faculty of Artificial Intelligence, Universiti Teknologi Malaysia(马来西亚理工大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对吉隆坡热带城市交通场景的隐私保护数据集构建难题,提出结合Grounding DINO与空间车辆ROI包含引擎的自动化匿名化框架,在1266帧图像上实现约95%的匿名化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15802 2026-08-18 cs.CV cs.LG 新提交 82%

PWLR: Pairwise Witness Local Rejection for Boundary-Aware Out-of-Distribution Detection

PWLR:用于边界感知分布外检测的成对见证局部拒绝

Chengyao Jia, Ruixuan Wang

机构 * Guangdong Provincial Key Laboratory of Stomatology(广东省口腔医学重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与先进计算重点实验室)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 针对视觉语言检测器极少用语言作为混淆ID类别边界证据的问题,提出PWLR方法,结合MLLM生成的局部线索与全局类别得分,在多基准上改进了视觉语言基线的OOD检测性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09761 2026-08-18 cs.LG cs.AI 版本更新 81%

Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization

在子符号强化学习环境中将LTL任务接地以实现零样本泛化

Matteo Pannacci, Andrea Fanti, Elena Umili, Roberto Capobianco

机构 * Sapienza University of Rome(萨皮恩扎大学罗马分校) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出在子符号强化学习环境中通过联合训练多任务策略和符号接地器,实现LTL任务的零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15419 2026-08-18 cs.CV 新提交 79%

ArtLang: Structured Language-to-Kinematics Grounding for Articulated 3D Actuation

ArtLang:面向铰接3D驱动的结构化语言到运动学的绑定

Sylvia Yuan, Dan Wang, Ravi Ramamoorthi, Xinrui Cui

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of North Texas(北得克萨斯大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究针对铰接物体控制的语义匿名问题,提出ArtLang框架,通过语义-运动学铰接图等技术实现开放词汇语言控制,经多类实验验证了可靠的语言绑定与连续铰接控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交 79%

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11426 2026-08-18 cs.RO 版本更新 78%

Grounding Robot Generalization in Training Data via Retrieval-Augmented VLMs

通过检索增强的视觉语言模型实现机器人在训练数据中的泛化

Jensen Gao, Dorsa Sadigh, Sandy Huang, Dhruv Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract)

AI总结 本文提出RADAR框架,通过检索和视觉语言模型分析,评估机器人策略在不同场景下的泛化能力,验证了其在大规模数据集中的有效性。

Comments IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15685 2026-08-18 cs.CV 新提交 70%

Counterfactual Sensitivity Is Not Repairability: Auditing Replay Probes for Video Evidence

反事实敏感性不等于可修复性:针对视频证据的重播探针审计

Rama AlHamidi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出黑盒反事实探针 CARVE,通过对比 SHAM 与 DESTROY 重播下的答案变化,审计视频智能体的证据依赖,在 LVBench 上取得准确率提升,验证了反事实敏感性与可修复性的差异。

Comments 23 pages, 2 figures. Code: https://github.com/KurbanIntelligenceLab/CARVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-08-18 cs.CV 版本更新 70%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11427 2026-08-18 cs.CV 版本更新 70%

Comprehension of Multilingual Expressions Referring to Target Objects in Visual Inputs

视觉输入中指代目标对象的多语言表达式理解

Francisco Nogueira, Alexandre Bernardino, Bruno Martins

机构 * Instituto Superior Técnico(技术高等学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对多语言指代表达式理解问题,构建了含10种语言的统一多语言数据集,提出基于多语言SigLIP2编码器的注意力锚定高效架构,验证了该模型在多语言视觉定位任务上的竞争力与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16188 2026-08-18 cs.OS 新提交 67%

AdaSprite: Resource-efficient Online Co-Adaptation for V2I Systems Under Large-scale Data Drifts

AdaSprite:大规模数据漂移下车路协同(V2I)系统的资源高效在线协同自适应

Lehao Wang, Zhiwen Yu, Sicong Liu, Kefan Chen, Fengmin Wu, Bin Guo

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 针对V2I系统大规模数据漂移下边缘资源受限的协同自适应问题,AdaSprite通过协同弹性扩缩等技术,使弱边缘支持17个并发V2I任务,SLO达成率与吞吐量分别提升1.6倍、2.1倍。

Comments MobiSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00600 2026-08-18 cs.RO 版本更新 67%

I-Perceive: A Foundation Model for Active Perception with Language Instructions

I-Perceive:一种基于语言指令的主动感知基础模型

Yongxi Huang, Zhuohang Wang, Wenjing Tang, Xinyu He, Cewu Lu, Panpan Cai

机构 * Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学)

专题命中 视觉定位与Grounding :VLM(abstract_cn);grounding(abstract)

AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16622 2026-08-18 cs.CV cs.AI 新提交 62%

HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes

HarmTrace:用于恶意梗图细粒度目标识别的锚定校准解耦优化方法

Yujia Li, Yiqun Zhang, Zihan Cheng, Yijie Huang, Tenglong Ye, Zihan Wang, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态恶意梗图检测中存在的目标识别错误问题,提出HarmTrace框架,结合实体感知微调与CTPO方法,在Qwen3-VL-8B上JRA提升至52.51%,还构建了Meme3W数据集与JRA指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15863 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交 62%

Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning

通过数据合成与统一规划扩展基于手册的家电操作规模

Yuxing Long, Lei Kang, Ziyan Yu, Yuzheng Gao, Bin Cheng, Jiyao Zhang, Xiaoqi Li, Haolin Yang, Dongjiang Li, Hui Shen, Hao Dong

机构 * Center on Frontiers of Computing Studies, School of Computer Science, Peking University(北京大学计算机学院计算前沿研究中心) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对现有大模型缺乏支持基于手册的家电操作规划的数据集的问题,提出MAGE数据合成流水线构建UseAppliance数据集,开发AppliancePlan模型,在RealAppliance-Bench和真实机器人实验中表现优异,推进通用家用机器人发展。

Comments Accepted by ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15032 2026-08-18 cs.CL cs.AI cs.CV 新提交 62%

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统

Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

机构 * Handoff AI Research(汉德夫人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。

Comments 15 pages, 7 figures. Evaluation harness available on https://github.com/handoffai/residential-takeoff-benchmark/. Request data via e-mail to research@handoff.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14391 2026-08-18 cs.CV cs.AI 版本更新 62%

Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估

Shuo Liang, Yixing Ma, Pengfei Zhou, Zhenglin Wan, Xingyan Chen, Zihan Mei, Manting Li, Feihan Chen, Zhiwen Wang, Bin Xu, Haotian Zhang, Jiajun Song, Shiya Su, Run Liu, Zhenghang Ni, Yifa Yu, Jintao Hong, Bolong Feng, Yifei Liu, Zirui Zhang, Jingxuan Zhang, Songlin Zhao, Yifan Bai, Kang Tan, Yizhe Liu, Junhao Du, Yongtao Ge, Zhaopan Xv, Xinyuan Zhang, Mengru Ma, Chunhua Shen, Wei Wang, Yang You, Zheng Zhu, Kaipeng Zhang, Wangbo Zhao

专题命中 视觉定位与Grounding :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。

Comments 63 pages, 20 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09562 2026-08-18 cs.CV cs.AI 版本更新 62%

Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges

分割一切模型中的提示工程:方法、应用与新兴挑战

Yidong Jiang, Jiangtong Li, Daiwei Cheng

机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本综述系统梳理了SAM的提示工程技术,将其分为三类并分析方法演变,探讨其跨领域应用,指出三大挑战并提出有前景的研究方向,为相关领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16515 2026-08-18 cs.CL cs.AI 新提交 57%

When Context Misleads: Intent-Guided Decoding for Robust Retrieval-Augmented Generation

当上下文产生误导时:用于稳健检索增强生成的意图引导解码

Haolin Jin, Pengyue Yang, Huaming Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对现有RAG系统固定信任策略的缺陷,提出意图引导解码(IGD)框架,经多基准评估,可显著提升事实恢复能力,同时保持或改善上下文遵循行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16222 2026-08-18 cs.RO cs.AI 新提交 57%

HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction

HiPHI:面向高精度人体运动与物体交互的大规模基准测试集

Jiahao Ji, Ji Ma, Runhan Zhang, Runyi Yu, Wenjia Wang, Weiheng Chi, Qianqian Peng, Weichao Yan, Yongfei Gu, Ye Tian, Ting Wu, Longwei Li, Chun Yuan, Ruoli Dai, Lei Han

机构 * National University of Singapore(新加坡国立大学) The University of Hong Kong(香港大学) SIGS, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology(香港科技大学) Noitom Robotics(诺亦腾机器人公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对现有具身数据集的局限,提出基于FrameNet的600+小时高保真人体运动与物体交互基准HiPHI,配套评估套件,为类人策略学习及计算机图形学运动先验模型提供数据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15919 2026-08-18 cs.IR cs.AI 新提交 57%

Noesis: Bidirectional Graph-RAG with Adaptive Parallelism and Cross-Knowledge-Base Semantic Discovery

Noesis:具备自适应并行性与跨知识库语义发现的双向图检索增强生成

Nicola Cogotti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出具备自适应并行性与跨知识库语义发现的双向图检索增强生成架构Noesis,通过四种算法解决现有Graph-RAG系统的三类局限,在HotpotQA数据集上超越GraphRAG,实现更优性能。

Comments 14 pages, 6 figures, 4 tables. Patent pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14765 2026-08-18 cs.AI cs.DB 新提交 57%

Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities and Trade-offs

无干净参考的智能体数据清洗:能力与权衡的实验研究

Hadi Fadlallah

机构 * Faculty of Arts and Sciences(文理学院) University of Sciences and Arts in Lebanon(黎巴嫩科学与艺术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出整合多组件的基于证据的无参考智能体数据清洗框架,经多数据集实验发现,额外能力会在多指标间引入权衡,无配置在所有标准上最优。

Comments 21 pages, 3 figures, Submitted to New Generation Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16760 2026-08-18 cs.LG math.OC 新提交 57%

On the Principles Behind Neural Network Optimizers

神经网络优化器背后的原理

Yushun Zhang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本论文为优化器Adam建立了有原则的基础,通过海森矩阵结构分析其在Transformer上优于SGD的原因,提出内存减半且性能不变的新优化器Adam-mini,还为其他NN优化器提供了新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16118 2026-08-18 cs.AI math.HO 新提交 57%

Assessing LLMs' mathematical abilities requires understanding the various mechanisms of mathematical creativity

评估大语言模型的数学能力需要理解数学创造力的多种机制

Silvère Gangloff

机构 * University of Ostrava(俄斯特拉发大学) IRAFM

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出数学创造力包含多种不可替代的机制,当前LLMs仅具备部分模式的能力,建议围绕该机制分类而非综合基准评估其数学能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09041 2026-08-18 cs.CY cs.AI cs.GR cs.HC cs.MM 版本更新 57%

Culturally-Aware AI for Cross-Boundary Community Learning: Undergraduate Innovation at the Intersection of Computation and Design

跨边界社区学习的文化感知AI:计算与设计交叉领域的本科生创新

Jiaojiao Zhao, Weisheng Zhang, Jiawen Cai, Haibin Gao, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学) Zhouzhuang Mystery of Life Museum(周庄生命之谜博物馆) Digital Innovation Research Center and Social Science Division(数字创新研究中心和社会科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一个协作框架,通过社区参与计算实现文化感知AI教育,促进社会工作和计算科学跨学科融合,应用于文化遗产保护与可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12381 2026-08-18 cs.CV 版本更新 57%

Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues

使用CLIP进行合成图像检测:理解和评估预测线索

Marco Willi, Melanie Mathys, Michael Graber

机构 * Institute for Data Science I4DS(数据科学研究所) University of Applied Sciences FHNW(应用科学大学) FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。

Comments 10 figures; 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16303 2026-08-18 cs.CL 新提交 50%

FTA-Mem: Fact-Time-Affect Anchored Memory for Low-Density Long-Term Dialogue

FTA-Mem:面向低密度长期对话的事实-时间-情感锚定记忆

Chang Liu, Shuyi Zhang, Changsheng Ma, Yongfeng Tao, Minqiang Yang, Bin Hu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出FTA-Mem结构化记忆框架,通过BWS形成情境片段并构建FTA单元,在ES-MemEval等数据集上提升了低密度长期对话的记忆问答性能,实现了证据保留与构建成本的有效权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏