arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2501.08982 2026-07-21 cs.CV 版本更新 70%

CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation

CityLoc:基于高斯表示的大规模场景文本描述的6自由度姿态分布定位

Qi Ma, Runyi Yang, Bin Ren, Nicu Sebe, Ender Konukoglu, Luc Van Gool, Danda Pani Paudel

机构 * Computer Vision Lab, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) University of Pisa(比萨大学) University of Trento(特伦托大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 研究大规模场景文本描述的6自由度姿态分布定位问题,核心方法是用基于扩散架构结合预训练文本编码器细化姿态,经3D高斯渲染提高精度,通过与标准方法对比验证其在多数据集上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14202 2026-07-17 cs.CV 新提交 70%

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

关键帧指南针:迈向对关键帧条件视频生成的全面评估

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究关键帧条件视频生成,提出关键帧指南针综合基准及自动评估框架,将关键帧执行分解为六个指标评估,通过实验揭示当前模型在关键帧执行与自然视频合成间存在权衡等局限性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04969 2026-07-14 cs.IR cs.AI 版本更新 70%

MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

MG$^2$-RAG:多粒度图用于多模态检索增强生成

Sijun Dai, Qiang Huang, Xiaoxing You, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08267 2026-07-10 cs.CV 新提交 70%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 70%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 70%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25706 2026-07-07 cs.CV 版本更新 70%

Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker

迈向开放世界的指代表达理解:一种无需训练的多任务一致性检查器基准

Zongjian Wu, Lei Zhang

机构 * School of Microelectronics and Communication Engineering, Chongqing University, Chongqing, China(微电子与通信工程学院,重庆大学,重庆,中国)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对现有指代表达理解(REC)基准局限于简单场景和单目标假设的问题,提出OpenRef基准,涵盖多样视觉场景、可变目标数量和丰富词汇类型,并引入无需训练的多任务一致性检查器(MCC)以提升模型在开放世界中的性能。

Comments 23 pages, 7 figures. Project Page: https://zongjianwu.github.io/openref

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00458 2026-07-07 cs.CV 版本更新 70%

VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors

VLOD-TTA: 视觉语言目标检测器的测试时适应

Atif Belal, Heitor R. Medeiros, Marco Pedersoli, Eric Granger

机构 * International Laboratory on Learning Systems (ILLS)(国际学习系统实验室(ILLS))

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出VLOD-TTA,通过密集提案重叠和图像条件提示实现低开销的视觉语言目标检测器测试时适应,优于现有方法。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02096 2026-07-03 cs.CV 新提交 70%

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension

LongEgoRefer: 长形式自我中心视频指代表达理解基准

Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

机构 * Woven by Toyota, Japan(丰田公司,日本) The University of Tokyo, Japan(东京大学,日本) National Institute of Informatics, Japan(日本信息机构国家研究所) Institute of Science Tokyo, Japan(东京科学研究所,日本) NII LLMC, Japan(日本信息机构LLMC) Kyoto University, Japan(京都大学,日本)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。

Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01707 2026-07-03 cs.CV 新提交 70%

LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression

LASER: 通过视觉注意力保持与沉没抑制为LVLMs提供矫正透镜

Bowen Yuan, Zijian Wang, Yadan Luo, Shijie Wang, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型在长序列解码中视觉遗忘的问题,提出LASER后训练框架,通过视觉接地奖励和沉没抑制奖励调节注意力轨迹与分布,在8个基准上超越强基线。

Comments The 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22435 2026-07-03 cs.RO cs.AI 版本更新 70%

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

CaP-X: 用于基准测试和改进机器人操作编码智能体的框架

Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

机构 * nvidia stanford(斯坦福大学) cmu(卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00530 2026-07-02 cs.RO cs.AI 新提交 70%

From Technical Metrics to User Perception: A User Study of a Multimodal Human-Robot Interaction System for Object Detection and Grasping

从技术指标到用户感知:面向物体检测与抓取的多模态人机交互系统用户研究

Jian Song, Tian Zi, Shen Guanting

机构 * Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 通过24名用户的受试内实验,验证了端到端任务成功率从75%提升至90%的技术改进能显著提升用户对速度、可靠性和整体能力的感知,且70.83%的用户偏好改进系统。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01115 2026-07-02 cs.CL cs.AI 新提交 70%

Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach

面向大学利益相关者的多模态聊天助手开发:基于RAG的方法

Md Abu Hanif Shaikh, Abdullah Al Shafi

机构 * Institute of Information and Communication Technology, Khulna University of Engineering & Technology(信息与通信技术研究所,库尔纳工程技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 针对大学利益相关者获取信息困难的问题,提出基于检索增强生成的多模态聊天系统,结合大语言模型与语义检索,支持文本和图像查询,将幻觉率从31.7%降至6.6%。

Comments Accepted at 2025 28th International Conference on Computer and Information Technology (ICCIT)

Journal ref 2025 28th International Conference on Computer and Information Technology (ICCIT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31367 2026-07-01 cs.MM cs.CV 新提交 70%

Evidence Triangulation for Multimodal Fact-Checking in the Wild

野外多模态事实核查的证据三角测量

Stefanos-Iordanis Papadopoulos, Zacharias Chrysidis, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Information Technologies Institute, Centre for Research & Technology, Hellas(希腊研究与技术中心信息技术研究所) Department of Electrical and Computer Engineering, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学电气与计算机工程系)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态事实核查中合成数据与真实数据差距大的问题,提出X-POSE基准和TRENT模型,通过三个并行交叉注意力流和关系融合机制进行证据三角测量,在真实数据上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00260 2026-07-01 cs.CV 版本更新 70%

TotalFM: An Organ-Separated 3D-CT Foundation Model Leveraging Large-Scale Routine Clinical Radiology Data

TotalFM:利用大规模常规临床放射学数据的器官分离3D-CT基础模型

Kohei Yamamoto, Tomohiro Kikuchi

机构 * Department of Radiology, Jichi Medical University(放射科,自治医科大学) Data Science Center, Jichi Medical University(数据科学中心,自治医科大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出TotalFM,一种基于器官分离的3D-CT放射学基础模型,通过自动化生成器官体积与发现句子对,结合VideoMAE自监督预训练和对比学习,在零样本器官级和发现级病变分类任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30393 2026-06-30 cs.CV 70%

SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization

SADL:该忽略什么?面向主体感知的干扰物定位基准

Cao-Tri Nguyen, Nguyen-Khoa Luong, Vinh-Tiep Nguyen, Minh-Triet Tran

机构 * University of Science(科学大学) Vietnam National University Ho Chi Minh City(越南胡志明市国家大学) University of Information Technology(信息技术大学) John Von Neumann Institute(约翰·冯·诺依曼研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出SADL基准,包含1,800个主体感知案例,用于评估视觉语言模型在干扰物定位中的排除校准能力,揭示模型过度排除的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28343 2026-06-30 cs.IR cs.AI 70%

The Crowded Embedding Space: A Mean-Field Mechanism for Emergent Marginalization in Retrieval-Augmented Agents

拥挤的嵌入空间:检索增强型智能体中涌现边缘化的平均场机制

Shwan Ashrafi, Dan Roth

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 研究检索增强型智能体中密集检索导致少数内容被边缘化的问题,通过静态和动态分析揭示平均场机制,证明局部相关性目标会系统性地排斥少数兴趣。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21526 2026-06-30 cs.CV 70%

VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection

VIGIL:基于部分的结构化推理用于通用深度伪造检测

Xinghan Li, Junhao Xu, Jingjing Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 VIGIL通过计划-检验流程,结合部分级证据和结构化推理,提升深度伪造检测的可解释性和泛化能力。

Comments Project Page: https://vigil.best

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12598 2026-06-30 cs.CV 70%

Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating

神经门:通过神经层面梯度门缓解LVLMs的隐私风险

Xiangkui Cao, Jie Zhang, Meina Kan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出Neural Gate方法,通过神经层面模型编辑提升LVLMs对隐私问题的拒绝率,增强隐私保护同时保持模型原有功能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10863 2026-06-29 cs.CV 版本更新 70%

Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding

超越序列距离:模态间距离不变位置编码

Lin Chen, Bolin Ni, Qi Yang, Zili Wang, Kun Ding, Ying Wang, Houwen Peng, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(MAIS,自动化研究所,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Tencent Hunyuan Team, China(腾讯文言团队,中国)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大模型在长上下文中的视觉衰减问题,提出模态间距离不变位置编码(DIPE),通过解耦模态间位置编码消除距离惩罚,保持视觉感知一致性,显著缓解视觉衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25585 2026-06-25 cs.CV 新提交 70%

FeVOS: Foresight Expression Video Object Segmentation

FeVOS:前瞻性表达视频目标分割

Kehan Lan, Kaining Ying, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出前瞻性表达视频目标分割任务,通过推理时空线索预测未来目标,并构建FeVOS数据集和FeVOS-R1模型,实现最先进性能。

Comments Accepted by ECCV 2026. Homepage: https://henghuiding.com/FeVOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18008 2026-06-25 cs.CV 新提交 70%

PhaseWin: An Efficient Search Algorithm for Faithful Visual Attribution

PhaseWin:一种用于忠实视觉归因的高效搜索算法

Zihan Gu, Junchi Zhang, Li Liu, Xiaochun Cao, Hua Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心) College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出PhaseWin算法,通过分阶段窗口搜索将视觉归因的计算复杂度从O(n²)降至O(n),在保持接近贪心算法忠实度的同时大幅减少模型评估次数。

Comments 26 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24539 2026-06-24 cs.CV 新提交 70%

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

PointVG-R: 通过视觉思维链在多模态大语言模型中内化几何推理以实现精确指向定位

Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出PointVG-R,通过强化学习和冷启动数据内化几何推理,结合视觉思维链数据集EgoPoint-CoT,在指向性视觉定位任务中实现mIoU提升15.86个点的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23917 2026-06-24 cs.CV 新提交 70%

Trustworthy Image Authentication using Forensic Knowledge Graphs

使用取证知识图谱的可信图像认证

Tai D. Nguyen, Matthew C. Stamm

机构 * Drexel University(德雷塞尔大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出取证知识图谱(FKG)框架,通过结构化取证证据提取与推理实现可解释的图像伪造检测,优于现有检测器和视觉语言模型。

Comments Accepted and Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23835 2026-06-24 cs.CV eess.IV 新提交 70%

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

ABACUS: 自适应统一基础模型,桥接图像计数理解与生成

Anindya Mondal, Sauradip Nag, Anjan Dutta

机构 * University of Surrey(萨里大学) Simon Fraser University(西蒙菲莎大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出ABACUS统一视觉语言模型,通过密度感知自适应缩放、边界感知计数策略和循环一致性GRPO,无需特定训练即可处理多种计数任务并生成计数忠实图像,在七个基准上达到最优。

Comments Under review, webpage: https://mondalanindya.github.io/ABACUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22339 2026-06-23 cs.CV 新提交 70%

T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

T-IMPACT:面向上下文图像-文本操纵的严重性感知基准

Gagandeep Singh, Aaditya Yadav, Priyanka Singh

机构 * The University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出T-IMPACT基准,包含98,786个图像-文本对,涵盖原始、仅图像、仅文本和联合操纵,通过校准的连续严重性分数和粗粒度标签评估操纵对上下文理解的影响,实验表明现有模型在严重性预测上仍远弱于人类判断。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17246 2026-06-17 cs.CV cs.MA 新提交 70%

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。

Comments 28 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11201 2026-06-16 cs.DB cs.AI 版本更新 70%

Bridging the Gap: Enabling Natural Language Queries for NoSQL Databases through Text-to-NoSQL Translation

弥合差距:通过文本到NoSQL翻译实现NoSQL数据库的自然语言查询

Jinwei Lu, Jiawei Lu, Chen Zhang, Zhiqian Qin, Haodi Zhang, Yuanfeng Song, Raymond Chi-Wing Wong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究Text-to-NoSQL任务,提出TEND基准和SAG求解器,用于将自然语言请求翻译为MongoDB聚合管道,验证了无模式文档推理的独特挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-06-12 cs.CL cs.AI cs.DB 版本更新 70%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract_cn);分类 cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10242 2026-06-11 cs.CV 版本更新 70%

MedVeriSeg: Teaching LISA-Like Medical Segmentation Models to Verify Query Validity Without Extra Training

MedVeriSeg: 教授LISA-like医学分割模型验证查询的有效性而无需额外训练

Qinyue Tong, Xiaozhen Wang, Ziqian Lu, Jun Liu, Yunlong Yu, Zheming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空宇航学院) Southern Medical University(南方医科大学) School of Computer Science and Technology (School of Artificial Intelligence), Zhejiang Sci-Tech University(浙江科技学院计算机科学与技术学院(人工智能学院)) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MedVeriSeg,一种无需训练的查询验证框架,使LISA-like医学分割模型能够拒绝虚假分割查询。通过相似性响应质量评分模块和轻量级路由多代理验证模块,提升验证鲁棒性,并构建MedVeriSeg-Bench基准,有效减少幻觉分割。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏