arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2607.03245 2026-07-07 cs.LG 新提交 57%

PhenoNEST: A Neuro-Symbolic Framework for Ontology-Aware Multimodal Plant Phenotyping and Trait Discovery

PhenoNEST:用于本体感知多模态植物表型分析和性状发现的神经符号框架

Jayant Ghadge, Soumyashree Kar, Surya S. Durbha

机构 * Centre of Studies in Resources Engineering (CSRE)(资源工程研究中心) Indian Institute of Technology Bombay(孟买印度理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.LG

AI总结 提出构建多模态粒状知识图谱框架,以弥合语义鸿沟,通过蒸馏野外记录提取实体和关系,结合模型与本体对齐,经视觉语言模型生成软图,引入节点连接多模态子图,成功映射野外观察,助力小麦育种。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02912 2026-07-07 cs.CV cs.HC cs.MM 新提交 57%

See the Emotion: A Facial Emoji Proxy Modeling for EEG Emotion Recognition

看见情感:用于脑电图情感识别的面部表情符号代理建模

Jingjing Hu, Guo Dan, Haofan Cheng, Ying Zeng, Zhan Si, Jinxing Zhou, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) PLA Information Engineering University(中国人民解放军信息工程大学) University of Science and Technology of China(中国科学技术大学) MBZUAI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究将脑电图可解释性重构为跨模态生成任务,提出面部表情符号代理建模框架,把高维脑电图信号转化为面部表情符号,在相关基准测试中取得先进准确率,能生成忠实面部动画展现大脑情感演变。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02814 2026-07-07 cs.MA cs.AI cs.CY 新提交 57%

SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure

主权谈判基准:在隐私、同意、证据和制度压力下评估委托谈判中用户拥有的个人代理

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究个人代理替用户谈判的情况,介绍主权谈判基准,其能在多方面约束下评估谈判,通过多种场景验证,指出仅协议成功对用户拥有的谈判代理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02719 2026-07-07 cs.CV 新提交 57%

GRCD: Grounded Region Change Detection for Multi-Finding Chest X-Ray Pairs

GRCD:用于多发现胸部X光对的地面区域变化检测

OFM Riaz Rahman Aranya, Peyman Najafirad, Kevin Desai

机构 * Department of Computer Science(计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 57%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02571 2026-07-07 cs.CV 新提交 57%

Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation

双自适应SAM3:基于低秩专家层的分层路由用于参数高效的医学图像分割

Ying Chen, Jinyue Li, Kun Wang, Qiankun Li, Yang Liu

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Imperial Global Singapore (IGS), Imperial College London(伦敦帝国理工学院新加坡帝国全球(IGS))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出双自适应SAM3框架,通过任务感知的动态专家路由器和参数感知的分解参数化专家设计,兼顾分割精度与参数效率,在医学图像分割上有高表现。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03513 2026-07-07 physics.chem-ph cs.LG 新提交 57%

AquaGen: Scaling generative models to molecular dynamics precision on thousands of atoms

AquaGen:将生成模型扩展到数千个原子的分子动力学精度

Emmanuel Bengio, Sanjeev Raja, Yui Tik Pang, Kerstin Klaeser, Cristian Gabellini, Nikhil Shenoy, Francesco Di Giovanni, Prudencio Tossou

机构 * Valence Labs(Valence实验室) UC Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 介绍AquaGen,首个全原子、显式溶剂、周期边界条件感知生成模型,以低成本从玻尔兹曼分布生成分子构型,用于后处理和预测相关属性,在绝对水合自由能预测上展示效用。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29596 2026-07-07 cs.SI cs.LG 版本更新 57%

Boundary Degree as a Node-level Feature for Epidemic Scenario Identification in Agent-based Cascade Simulations

边界度作为基于智能体的级联模拟中流行病场景识别的节点级特征

Amro Alabsi Aljundi, Galen Harrison, Jiangzhuo Chen, Abhijin Adiga, Anil Kumar Vullikanti, Madhav V. Marathe

机构 * Biocomplexity Institute(生物复杂性研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出边界度作为节点级级联特征,通过消融实验证明其单独提升场景识别准确率19%,并理论证明无边界或边信息时某些场景不可区分。

Comments 28 pages, 10 figures, preliminary version; not final

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20494 2026-07-07 cs.LG physics.ao-ph stat.AP 版本更新 57%

A 10,000-Year Global Stochastic Tropical Cyclone Catalog with Wind-Dependent Track Transitions (WHITS)

具有风依赖性路径转换的10,000年全球随机热带气旋目录(WHITS)

Jennifer Nakamura, Upmanu Lall

机构 * Lamont-Doherty Earth Observatory, Columbia University(哥伦比亚大学拉蒙特-多赫蒂地球观测站) School of Complex Adaptive Systems, Arizona State University(亚利桑那州立大学复杂适应系统学院) Earth and Environmental Engineering, Columbia University(哥伦比亚大学地球与环境工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出WHITS方法,通过非参数半马尔可夫路径生成器生成全球10,000年合成气旋目录,以提高保险损失评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07233 2026-07-07 cs.AI 57%

From "Thinking" to "Justifying": Aligning High-Stakes Explainability with Professional Communication Standards

从‘思考’到‘证明’:将高风险可解释性与专业沟通标准对齐

Chen Qian, Yimeng Wang, Yu Chen, Lingfei Wu, Andreas Stathopoulos

机构 * William & Mary(威廉玛丽学院) Anytime AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出‘结果->证明’方法,通过结构化可解释性框架SEF提升系统输出的可验证性与可靠性,在三个领域四个任务中验证了该方法的有效性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 24628-24637

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 57%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10733 2026-07-07 cs.RO cs.LG 57%

BaTCAVe: Trustworthy Explanations for Robot Behaviors

BaTCAVe:机器人行为的可信解释

Som Sagar, Aditya Taparia, Harsh Mankodiya, Pranav Bidare, Yifan Zhou, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。

Comments 19 pages, 26 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新 57%

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02024 2026-07-03 cs.CV 新提交 57%

Spatio-Temporal and Clinical Conditioning for Fine-Grained Radiology Report Retrieval

细粒度放射学报告检索的时空与临床条件化

P. Sloan, E. Simpson, M. Mirmehdi

机构 * Department of Computer Science University of Bristol(计算机科学系 布里斯托大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出STAR3框架,通过区域级解剖信息与临床指征及纵向变化对齐,实现基于检索的放射学报告生成,在MIMIC-CXR上优于现有方法。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01256 2026-07-03 cs.CY cs.AI 新提交 57%

AI Assistance for Human Review of Default Judgments

AI辅助人类审查缺席判决

Theodora Worledge, Othman Bensouda Koraichi, Daniel Bernal, Aviv Caspi, Tatsunori Hashimoto, Carlos Guestrin, David Freeman Engstrom

机构 * Stanford Computer Science(斯坦福大学计算机科学系) Stanford Law School(斯坦福法学院) University of Chicago Law School(芝加哥大学法学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对美国法院每年审查数百万份缺席判决耗时且易错的问题,本文提出Default Assistant,利用大语言模型评估案件法律要求并提供引用建议。实验表明,AI辅助使审查准确率提高6.0%,速度提高25.9%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17965 2026-07-03 cs.SE cs.AI 版本更新 57%

BLAgent: Agentic RAG for File-Level Bug Localization

BLAgent: 一种面向文件级Bug定位的代理RAG

Md Afif Al Mamun, Gias Uddin

机构 * University of Calgary(卡尔加里大学) York University(约克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出BLAgent,一种新型代理RAG框架,用于文件级Bug定位,通过结合代码结构感知的仓库编码、双视角查询转换和两阶段代理重排序,提高了Bug定位的准确性和效率。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09446 2026-07-03 cs.CV 版本更新 57%

Defect-aware Hybrid Prompt Optimization via Progressive Tuning for Zero-Shot Multi-type Anomaly Detection and Segmentation

基于渐进调优的缺陷感知混合提示优化用于零样本多类型异常检测与分割

Nadeem Nazer, Hongkuan Zhou, Lavdim Halilaj, Ylli Sadikaj, Steffen Staab

机构 * Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) Otto-von-Guericke-University(奥托·冯·格里克大学) Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) Faculty of Computer Science, UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学系) University of Southampton(南安普顿大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出DAPO框架,通过混合提示机制结合可读缺陷描述与可学习嵌入,对齐异常视觉特征与文本语义,在零样本多类型异常检测与分割任务中平均提升AUROC 3.6%和5.2%。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04520 2026-07-03 cs.AI 版本更新 57%

Aria: An Agent For Retrieval and Iterative Auto-Formalization via Dependency Graph

Aria: 基于依赖图的检索与迭代自动形式化智能体

Hanyu Wang, Ruohan Xie, Yutong Wang, Guoxiong Gao, Xintao Yu, Bin Dong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出Aria系统,通过两阶段思维图过程递归分解定理陈述为依赖图并构建形式化,结合AriaScorer验证语义正确性,在ProofNet、FATE-X和同调猜想数据集上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00828 2026-07-02 cs.DB cs.AI 新提交 57%

Exploring the Semantic Gap in Agentic Data Systems: A Formative Study of Operationalization Failures in Analytical Workflows

探索智能体数据系统中的语义鸿沟:分析工作流中操作化失败的形成性研究

Jalal Mahmud, Eser Kandogan

机构 * Megagon Labs(Megagon实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究通过跨领域分析236个分析意图,识别出153种反复出现的操作化失败,归纳为五类语义鸿沟,揭示用户分析概念与系统可用信息之间的差距,并提出未来智能体数据系统需要更丰富的语义表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00500 2026-07-02 physics.med-ph cs.CV 新提交 57%

Closed-loop coupling of personalised and foundation models for real-time treatment guidance with MRI

个性化模型与基础模型的闭环耦合用于MRI实时治疗引导

James Grover, Emily A. Hewson, Andrew Phair, Michael Ferraro, Hilary L. Byrne, Paul Keall, Michael G. Jameson, David E. J. Waddington

机构 * Image X Institute, Sydney School of Health Sciences, Faculty of Medicine and Health, The University of Sydney, Sydney, Australia(悉尼大学医学与健康学院悉尼健康科学学院Image X研究所,悉尼,澳大利亚) GenesisCare, Sydney, Australia(GenesisCare,悉尼,澳大利亚) School of Clinical Medicine, Medicine & Health, University of New South Wales, Sydney, Australia(新南威尔士大学医学与健康学院临床医学系,悉尼,澳大利亚) Centre for Medical Radiation Physics, School of Mathematics and Physics, University of Wollongong, Wollongong, Australia(伍伦贡大学数学与物理学院医学辐射物理中心,伍伦贡,澳大利亚)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出一种闭环耦合框架,结合个性化时间预测模型与基础模型的连续分割解剖解释,实时补偿MRI引导治疗中的成像延迟,在400毫秒预测范围内改善解剖预测并减少剂量误差。

Comments 18 pages, 8 figures, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31522 2026-07-02 cs.CL cs.AI 新提交 57%

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准

Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) McGill University(麦吉尔大学) The Fin AI(Fin AI公司) Kyoto University(京都大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。

Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31597 2026-07-02 cs.CV 版本更新 57%

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

SOCO: 视觉基础模型中语义对象对应关系的基准测试

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) Saarland Informatics Campus(萨尔州信息学校园) CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) University of Freiburg(弗赖堡大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。

Comments Project page: https://genintel.github.io/SOCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14113 2026-07-02 cs.CL cs.AI cs.CR 版本更新 57%

Toward Cybersecurity-Expert Small Language Models

面向网络安全专家的小型语言模型

Matan Levi, Daniel Ohayon, Ariel Blobstein, Ravid Sagi, Ian Molloy, Yair Allouche

机构 * IBM Research(IBM研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对网络安全领域缺乏高质量领域模型和训练数据的问题,提出CyberPal 2.0系列小型语言模型(4B-20B参数),通过SecKnowledge 2.0管道生成增强的思维链指令数据集,在多项网络安全基准测试中超越基线并匹配或超越前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31614 2026-07-01 eess.SY cs.AI cs.SY 新提交 57%

Automating Cause-Effect Specification with Knowledge Graphs and Large Language Models

利用知识图谱和大语言模型自动化因果规范生成

Javal Vyas, Milapji Singh Gill, Mehmet Mercangöz

机构 * Autonomous Industrial Systems Lab, Imperial College London(帝国理工学院自主工业系统实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种语义AI框架,结合知识图谱与约束大语言模型,自动生成因果逻辑和操作安全叙述,减少手动工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29965 2026-07-01 cs.AI 版本更新 57%

Meta-Programming for Linear-time Temporal Answer Set Programming

线性时态回答集编程的元编程

Susana Hahn, Amadé Nemes, Javier Romero, Torsten Schaub

机构 * University of Potsdam, Germany(波恩大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种统一的元编程框架,通过扩展clingo的理论语法并引入转换管道保护嵌套模态,实现了对多种线性时态逻辑(TEL、MEL、DEL)的语义操作化,并开发了metasp系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21466 2026-07-01 cs.CV 版本更新 57%

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新 57%

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14171 2026-07-01 cs.AI 版本更新 57%

Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance

Paper2Rebuttal: 一种透明的作者回复辅助多智能体框架

Qianli Ma, Chang Guo, Zhiheng Tian, Siyu Wang, Jipeng Xiao, Yuanhao Yue, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出多智能体框架RebuttalAgent,将回复生成重构为以证据为中心的规划任务,通过分解反馈、构建混合上下文和外部搜索模块,提升覆盖度、忠实性和策略连贯性。

Comments Accepted by ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 57%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30638 2026-06-30 cs.CV 57%

Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors

开放词汇与指代分割:利用2D检测器实现3D高斯

Jameel Hassan, Yasiru Ranasinghe, Vishal Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出GaussDet方法,利用离散的2D开放词汇检测器与指代表达能力,通过视图聚合语义标签分布实现3D场景的开放词汇分割和指代分割,在零样本设置下显著提升指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏