arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2606.01753 2026-06-02 cs.CV 57%

Quality-Guided Semi-Supervised Learning for Medical Image Segmentation

质量引导的半监督学习用于医学图像分割

Kumar Abhishek, Ghassan Hamarneh

机构 * School of Computing Science, Simon Fraser University, Canada(Simon Fraser大学计算机科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出一种质量引导的半监督学习框架,通过专用网络估计分割质量,并利用质量感知正则化和伪标签重加权提升医学图像分割性能。

Comments Early Accept at MICCAI 2026, 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01461 2026-06-02 cs.LG cs.MA 57%

Genotype-Conditioned Molecular Generation via Evidence-Grounded Multi-Objective Latent Perturbation in Diffusion Models

基于证据的多目标潜在扰动在扩散模型中的基因型条件分子生成

Brenda Nogueira, Gisela A. Gonzalez-Montiel, Nitesh V. Chawla, Nuno Moniz

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Notre Dame(诺克斯大学) Department of Chemistry and Biochemistry(化学与生物化学系) Lucy Family Institute for Data & Society(数据与社会学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出一种在预训练的基因型到药物扩散模型的潜在空间中,通过梯度上升优化可学习扰动以最大化药物敏感性、类药性和合成可及性的复合奖励,并利用实验数据和LLM管道确保生物合理性和机制一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01322 2026-06-02 cs.CL cs.AI 57%

TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

TukaBench: 一个基于文化的非洲语言越狱基准

Victor Akinode, Senyu Li, Wassim Hamidouche, Waqas Zamir, Inbal Becker-Reshef, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) Microsoft AI for Good Research Lab(微软人工智能造福人类研究实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对大型语言模型在非洲低资源语言上的安全评估缺失,提出TUKABENCH基准,通过四种设置(直接翻译、文化适应翻译、人工策划提示、代码切换提示)评估语言、文化背景和提示规避性对模型安全的影响,发现非洲语言提示降低拒绝率,并引入Deflection指标和人工验证以解决模型理解失败和评判可靠性问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01223 2026-06-02 cs.CL cs.AI 57%

Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue

连接点:长时对话中的反思性记忆基准测试

Jingjie Lin, Bingbing Wang, Zihan Wang, Zhengda Jin, Weiming Qiao, Jing Li, Ruifeng Xu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University(香港理工大学) Fudan University(复旦大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对现有基准无法衡量从碎片化多模态线索合成高层解释的反思性记忆问题,提出RefMem-Bench基准和REMIND层次框架,通过渐进式证据感知、定位和抽象提升模型反思性记忆能力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01199 2026-06-02 cs.AI 57%

Can LLM Agents Sustain Long-Horizon Organizational Dynamics?

LLM智能体能否维持长期组织动态?

Xuancheng Zhu, Yang Yue, Shuaibing Wan, Zihan Dou, Xiaohan Zhang, Yongrui Liu, Guoshun Nan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出TaskWeave分层智能体框架,通过记忆中心的协调机制(规划-分解-诊断-对齐循环和依赖感知追踪记忆)实现长期组织模拟,实验表明该框架能维持连贯的组织动态并产生可靠的人工制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01149 2026-06-02 cs.CV 57%

CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection

CoSTL:面向时刻检索与高亮检测的综合时空表征学习

Xin Dong, Wenjia Geng, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出综合时空表征学习框架CoSTL,通过文本驱动的渐进细粒度图像编码器和多尺度时间感知模块,联合学习空间细节与时间动态,在时刻检索和高亮检测任务上达到最优性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00826 2026-06-02 cs.LG 57%

Partial Fairness Awareness: Belief-Guided Strategic Mechanism for Strategic Agents

部分公平意识:面向策略代理的信念引导策略机制

Xinpeng Lv, Chunyuan Zheng, Yunxin Mao, Renzhe Xu, Hao Zou, Shanzhi Gu, Liyang Xu, Huan Chen, Yuanlong Chen, Wenjing Yang, Haotian Wang

机构 * National University of Defense Technology, Changsha, China(国防科技大学) Peking University, Beijing, China(北京大学) Shanghai University of Finance and Economics, Shanghai, China(上海财经大学) ZGC Laboratory, Beijing, China(ZGC实验室) Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 针对策略分类中的公平暴露困境,提出部分公平意识(PFA)问题,通过发布公平约束候选集并隐藏真实约束,结合信念引导机制实现代理与系统公平约束的对齐,实验表明PFA在降低群体公平差距、提高合格个体接受率和结果稳定性方面优于完全公开或私有的公平机制。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00756 2026-06-02 cs.AI 57%

CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems

CoMIC:云边系统中长周期LLM代理的协作记忆与洞察循环

Yannan Wang, Longli Yang, Zhen Liu, Abhishek Kumar, Carsten Maple

机构 * Beijing Jiaotong University(北京交通大学) The Alan Turing Institute(艾伦·图灵研究所) University of Warwick(沃里克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出无需参数更新的云边框架CoMIC,通过集中式反思与分布式执行设计,利用语义子目标标识实现跨代理经验聚合,提升弱边缘代理在长周期任务中的进展率和动作基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00518 2026-06-02 cs.AI 57%

Acting with AI: An Interaction-Based Framework for Agentic Tort Liability

与AI行动:基于交互的代理侵权责任框架

Yiheng Yao

机构 * Yiheng Yao(姚艺恒)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文基于Bratman规划理论和普通法人类协同行动原则,提出一种交互分类框架(自主漂移、纯工具使用、协作规划)来分配AI代理系统的侵权责任,并引入“合理代理”标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00432 2026-06-02 cs.LG 57%

Grounded Decoding: Retrieval-Anchored Probability Fusion for Faithful RAG

Grounded Decoding: 面向忠实RAG的检索锚定概率融合

Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系) Department of Computer Science, Kalinga Institute of Industrial Technology(卡林加工业技术学院计算机科学系) Department of Civil, Construction & Environmental Engineering, Iowa State University(爱荷华州立大学土木、建设与环境工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出Grounded Decoding,一种无需训练的推理时解码框架,通过KL-重心目标融合全RAG分布和仅检索分布,并引入冲突感知自适应加权,以提升RAG的事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00104 2026-06-02 cs.RO cs.AI 57%

PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs

PEACE: 一种用于无人机的带约束执行的规划-执行智能体

Erdem Uysal, Timo Kehrer, Sebastiano Panichella

机构 * Institute of Computer Science, University of Bern(伯尔尼大学计算机科学研究所) AI4I - The Italian Institute of Artificial Intelligence(意大利人工智能研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 提出一种基于大语言模型的规划-执行智能体架构,通过解耦高层任务规划与低层控制,并引入约束执行层和有限重规划,实现无人机可解释、可约束的自主飞行。

Comments Accepted to ICRA 2026 Workshop on Semantics for Reliable Robot Autonomy: From Environment Understanding and Reasoning to Safe Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13937 2026-06-02 cs.LG cs.SE 57%

iML: Executable, Problem-Grounded, and Broadly Exploratory Code-Driven AutoML

iML: 可执行、问题驱动且广泛探索的代码驱动自动机器学习

Dat Le, Duc-Cuong Le, Anh-Son Nguyen, Tuan-Dung Bui, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息科技学院,越南工程与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出iML多智能体框架,通过任务分析、数据剖析、结构化蓝图生成和模块化代码合成,实现可执行、问题驱动且广泛探索的代码驱动AutoML,在MLE-BENCH和iML-BENCH上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08038 2026-06-02 cs.CL cs.AI 57%

AblationBench: Evaluating Automated Planning of Ablations in Empirical AI Research

AblationBench:评估实证AI研究中消融实验的自动规划

Talor Abramovich, Gal Chechik

机构 * Google Research(谷歌研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出AblationBench基准套件,包含作者消融和审稿人消融两个任务,用于评估语言模型在AI研究中规划消融实验的能力,实验表明当前最佳模型仅能识别45%的原始消融,低于人类水平。

Comments AI4Science Workshop, ICML 2026; Project page: https://ablation-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31143 2026-06-01 cs.HC cs.AI 57%

Extending the UXR Point of View Pyramid: A Generative AI-Augmented Methodology for Human-Centred AI Systems

扩展UXR观点金字塔:一种面向人本AI系统的生成式AI增强方法论

Festus Fatai Adedoyin, Huseyin Dogan, Melike Akca, Abiodun Adedeji

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算机与工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对英国债务管理中的AI金融系统,通过扩展UXR观点金字塔,提出一种结合生成式AI的增强方法论,包括AI增强观点金字塔、结构化提示架构和AI驱动的Playbook卡片系统,以提升可解释性、公平性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30637 2026-06-01 cs.AI 57%

EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs

EHRBench: 基于电子健康记录的自动化可靠临床决策基准测试,用于大语言模型

Yuzhang Xie, Keqi Han, Yunpeng Xiao, Hejie Cui, Guanchen Wu, Ziyang Zhang, Kai Shu, Jiaying Lu, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出EHRBench,通过EHR-LLM-KB交互流水线自动构建近百万问答对,涵盖诊断、治疗和预后三大临床决策任务,系统评估30余种LLM的性能与鲁棒性。

Comments Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Datasets and Benchmarks Track, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29146 2026-06-01 cs.CL cs.AI 57%

SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation

SafeRx-Agent: 基于知识的多智能体框架用于安全且可解释的药物推荐

Xinyu Wang, Hanwei Wu, Zhenghan Tai, Sicheng Lyu, Qincheng Lu, Ziyu Zhao, Jijun Chi, Jingrui Tian, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) McMaster University(麦马斯特大学) University of Toronto(多伦多大学) Ohio University(俄亥俄大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出SafeRx-Agent,一种基于知识的多智能体框架,通过患者上下文、外部临床知识和安全验证来推荐可追溯的药物集合,在MIMIC-III和MIMIC-IV数据集上提高了细粒度药物预测准确性,同时控制了药物相互作用、禁忌症和药物集合大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10468 2026-06-01 eess.AS cs.AI cs.HC cs.MM cs.SD 57%

G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition

G-STAR: 端到端全局说话人跟踪属性识别

Jing Peng, Ziyi Chen, Haoyu Li, Yucheng Wang, Duo Ma, Mengtian Li, Yunfan Du, Dezhu Xu, Kai Yu, Shuai Wang

机构 * Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院) ETH Zürich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出G-STAR框架,通过缓存条件说话人跟踪模块与Speech-LLM转录骨干耦合,实现长时重叠多说话人语音的端到端说话人属性识别,支持组件优化和联合训练,在局部和全局评估中均表现优异。

Comments submitted to Emnlp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30251 2026-05-29 cs.CL cs.AI 57%

Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models

相同证据,不同答案:面向多轮语言模型的规范上下文在线策略蒸馏

Zizhuo Lin, Quanling Liu, Jinsheng Quan, Chao Zhang, Yifan Zhu, Xing Shi, Jingtao Xu, Zhihui Li, Yawei Luo

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出规范上下文在线策略蒸馏(CCOPD)方法,通过教师-学生框架对齐模型在完整提示和逐步揭示信息下的行为,减少自我锚定漂移,在多轮数学对话上训练后,在原始分片任务上平均提升32%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30094 2026-05-29 cs.AI cs.GT 57%

PokerSkill: LLMs Can Play Expert-Level Poker without Training or Solvers

PokerSkill: 无需训练或求解器,大语言模型可达到专家级扑克水平

Boning Li, Baoxiang Wang, Longbo Huang

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出PokerSkill框架,通过规则驱动的技能库约束大语言模型动作,无需训练或求解器即可在扑克中达到接近GTO水平的性能。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20612 2026-05-29 cs.LG 57%

Matryoshka Concept Bottleneck Models

Matryoshka 概念瓶颈模型

Ziye Chen, Hongbin Lin, Jie Li, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出 Matryoshka 概念瓶颈模型 (MCBM),通过嵌套层次结构实现自适应概念利用,将预期干预成本从线性降低到对数阶 O(log K),同时保证单调性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29522 2026-05-29 cs.AI 57%

DeepSurvey: Enhancing Analytical Depth and Citation Reliability in Automated Survey Generation

DeepSurvey: 提升自动综述生成中的分析深度与引用可靠性

Ziyue Yang, Da Ma, Hanqi Li, Zijian Wang, Tiancheng Huang, Zijian Hu, Chenrun Wang, Yunzhe Zhang, Xiaobao Wu, Kai Yu, Lu Chen

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出DeepSurvey智能体系统,通过结构化全文笔记、跨论文关系建模和代码仓库分析增强分析深度,结合引文图扩展与混合过滤、证据约束引用分配及多粒度智能体精炼提升引用可靠性,在内容质量和引用准确性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05614 2026-05-29 cs.CL cs.AI 57%

GroundAct: Can LLM Agents Ground Actions in Environmental States?

GroundAct:LLM智能体能否在环境状态中实现动作落地?

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出GroundAct基准,通过1500个场景和16592个任务实例评估15个LLM,发现动作落地能力是多维挑战,不能仅通过模型规模解决。

Comments Project Page: https://zju-real.github.io/OmniEmbodied Code: https://github.com/ZJU-REAL/OmniEmbodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI 57%

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28666 2026-05-28 cs.AI 57%

An LLM-Based Assistance System for Intuitive and Flexible Capability-Based Planning

基于LLM的直观灵活能力规划辅助系统

Luis Miguel Vieira da Silva, Nicolas König, Felix Gehlhoff

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种混合辅助系统,将基于能力的形式化SMT规划与LLM自然语言交互层结合,通过人机协同实现规划解释与知识模型自适应,提升工业自动化中能力规划的可访问性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28459 2026-05-28 cs.CV 57%

REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection

REVEAL:基于参考依据的多模态篡改检测推理

Jun Zhou, Bingwen Hu, Yaxiong Wang, Zhedong Zheng, Yongzhen Wang, Yuchen Zhang, Ping Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出REVEAL框架,通过参考依据验证和差异感知融合机制,结合任务解耦的混合专家架构,实现多模态篡改检测与定位,并支持无训练域适应。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28348 2026-05-28 cs.CV 57%

Toward Semantic-Agnostic and Shape-Aware Vision-Language Segmentation Models

面向语义无关和形状感知的视觉-语言分割模型

Corentin Seutin, Mohamed Amine Ettaki, Michaël Clément, Pierrick Coupé, Rémi Giraud

机构 * Univ. Bordeaux, CNRS, Bordeaux INP, LaBRI, UMR 5800, France(波尔多大学,法国国家科学研究中心,波尔多理工学院,LaBRI实验室,UMR 5800,法国) Univ. Bordeaux, CNRS, Bordeaux INP, IMS, UMR 5218, France(波尔多大学,法国国家科学研究中心,波尔多理工学院,IMS,UMR 5218,法国)

专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.CV

AI总结 提出语义无关且形状感知(SANSA)分割范式,通过非语义文本描述微调模型,在保持语义提示性能的同时,在新任务上提升高达20% mIoU。

Comments Accepted at the 2026 IEEE International Conference on Image Processing (ICIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28303 2026-05-28 cs.AI 57%

From Fact Overwriting to Knowledge Evolution: Causal Editing via On-Policy Self-Distillation

从事实覆写到知识演化:基于同策略自蒸馏的因果编辑

Shuaike Li, Kai Zhang, Xianquan Wang, Jiachen Liu, Shengpeng Mo

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对知识编辑中静态事实覆写范式导致认知失调的问题,提出基于因果引导的同策略蒸馏方法CODE,将事实注入转化为连贯的知识演化,显著降低自反驳率并提升多跳准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28257 2026-05-28 cs.CV 57%

Category-Level 3D Correspondence in Camera Space via Morphable Object Priors

基于可变形对象先验的相机空间类别级3D对应

Leonhard Sommer, Artur Jesslen, Basavaraj Sunagad, Adam Kortylewski

机构 * University of Freiburg, Germany(弗赖堡大学,德国) CISPA Helmholtz Center for Information Security, Germany(信息安全部署中心,德国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 通过学习共享可变形对象先验,从单张图像预测类别内实例间一致的3D位置,无需显式对应监督,并在新基准HouseCorr3D上达到最优。

Comments 14 pages, 4 figures. Data and code are publicly available at https://github.com/GenIntel/HouseCorr3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28232 2026-05-28 cs.AI 57%

PIRS: Physics-Informed Reward Shaping for SAC-Based Building Energy Management

PIRS:基于物理信息奖励塑形的SAC建筑能源管理

Shadmehr Zaregarizi, Khashayar Yavari

机构 * Politecnico di Torino(托里尼理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对深度强化学习中奖励函数设计缺乏物理基础的问题,提出PIRS方法,将ISO 7730 PMV公式嵌入SAC的多目标奖励中,提升可解释性和性能。

Comments N pages, 4 figures, 3 tables. Accepted at the 2nd Workshop on AI-Driven Energy Efficiency in Dynamic Systems (AI-DEEDS '26), co-located with ACM e-Energy / ACM Sustainability Week, Banff, AB, Canada, June 22-25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28173 2026-05-28 cs.CV 57%

MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation

MangaFlow: 一种用于可控故事到漫画生成的端到端代理框架

Muyao Wang, Zeke Xie, Yanhao Chen, Lixin Xiu, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出MangaFlow代理框架,通过将漫画创作分解为规划、定位、布局构建、参考条件渲染、合成和文字放置等步骤,实现可控的长篇漫画生成,支持布局和视觉参考作为显式中间变量,并引入故事段落记忆以保持跨面板一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏