arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2608.07015 2026-08-10 cs.CV 新提交 57%

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

先理解再检测:用于全域红外小目标检测的视觉-语言学习

Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An

机构 * National University of Defense Technology(国防科技大学) College of Computer Science, Nankai University(南开大学计算机学院) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06913 2026-08-10 cs.CV 新提交 57%

MuST-VAD: Mutual Structured Learning for Video Anomaly Detection

MuST-VAD:用于视频异常检测的互结构化学习

Satoshi Hashimoto, Hitoshi Nishimura, Mori Kurokawa

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MuST-VAD是用于弱监督视频异常检测的互结构化学习框架,通过检测器与LVLM的双向知识交换,在UCF-Crime数据集上显著提升了检测精度,AP优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08808 2026-08-10 cs.CV 57%

Identity-Preserving Aging and De-Aging of Faces in the StyleGAN Latent Space

Luis S. Luevano, Pavel Korshunov, Sebastien Marcel

机构 * Idiap Research Institute(Idiap研究机构)

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV

Comments Accepted for publication in IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05983 2026-08-07 cs.CV 新提交 57%

Universal Concept Disruption for SAM3 Image Segmentation

用于SAM3图像分割的通用概念干扰

Hao Wang, Yuxuan Zhang, Wei Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对SAM3图像分割的对抗鲁棒性空白,提出通用概念干扰(UCD)攻击方法,在多数据集上显著降低SAM3的分割性能,且扰动可跨SAM3.1及视频推理迁移,仅有限恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05219 2026-08-07 cs.AI 新提交 57%

When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents

当特权指导出现错位:面向多轮智能体的状态匹配路由与语境化自蒸馏

Junzhuo Liu, Weiwei Li, Jun Ling, Peng Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对多轮智能体特权指导的状态-参考不匹配问题,提出SMRC-SD方法,通过状态匹配路由与语境化自蒸馏提升了ALFWorld和WebShop任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01905 2026-08-07 cs.CV 版本更新 57%

PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph

PhotoHOI:从单张RGB照片合成3D手-物体交互

Zhenhao Zhang, Jiajun Zhang, Wei Min, Yebin Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 PhotoHOI从单张RGB照片与开放词汇指令合成3D手-物体交互,通过视觉-语言模型解析任务规格、规划碰撞感知轨迹、学习接触与抓取先验,在GRAB、H2O数据集及真实照片上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11402 2026-08-07 cs.CV 版本更新 57%

SCD4VPR: Multi-modal Scene Change Detection for Long-term Visual Place Recognition Database Update

基于视觉-语言表示学习的场景变化检测

Diwei Sheng, Vijayraj Gohil, Satyam Gaba, Zihan Liu, Giles Hamilton-Fletcher, John-Ross Rizzo, Yongqing Liang, Chen Feng

机构 * New York University(纽约大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出LangSCD框架,通过融合语言和视觉信息提升场景变化检测的鲁棒性,引入几何-语义匹配模块和多类标注数据集NYC-CD,实验证明其在多个基准上的优越性能。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04750 2026-08-06 cs.CV cs.CL cs.MM 新提交 57%

Simile Understanding in Text-to-Image Models: An Evaluation Framework

文本到图像模型中的明喻理解:一个评估框架

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

机构 * The University of Tokyo(东京大学) Nara Institute of Science and Technology(奈良科学技术研究所) Chungnam National University(忠南国立大学) Institute of Science Tokyo(东京科学大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。

Comments Accepted as a full paper at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04424 2026-08-06 cs.CV 新提交 57%

Thinking with Anchors: Grounded and Efficient Document Reasoning

基于锚点思考:接地且高效的文档推理

Sichen Zhu, Yuchen Zhu, Wenzhuo Xu, Jason Kuen, Wanrong Zhu, Jing Shi, Xuan Shen, Quanyi Wang, Yiwei Wang, Yujun Cai, Bing Shuai, Qin Zhang, Yongxin Chen, Shilong Liu, Molei Tao, Jiuxiang Gu

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学) Adobe(奥多比公司) ZJU(浙江大学) NUIST(南京信息工程大学) SEU(东南大学) Physion Labs(Physion实验室) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 该研究提出面向推理的ADOPD 2026数据集,将多类文档元素转化为视觉锚点,支持区域语义标注、统一视觉-语言接地等能力,解决现有模型在文档计数任务上的不足,推动文档理解向锚点接地的智能方向发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04077 2026-08-06 cs.AI cs.CL 新提交 57%

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

FinProBench:基于专业交付物衍生的角色基准评估金融AI智能体

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究推出FinProBench金融AI智能体基准及RGRC角色基准构建流程,实验显示RGRC在角色专业化角色评估上优于仅提示方法,角色级复用基准可大幅减少工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新 57%

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05451 2026-08-06 cs.LG cs.CL 版本更新 57%

RingSQL: Schema-Independent Synthetic Data Generation for Text-to-SQL Reinforcement Learning

RingSQL: 通过不依赖模式的模板生成合成数据以用于文本到SQL推理模型

Marko Sterbentz, Kevin Cushing, Cameron Barrie, Kristian J. Hammond

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 RingSQL通过结合不依赖模式的模板和大语言模型生成,提升文本到SQL模型的准确性和多样性

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03911 2026-08-05 cs.CV 新提交 57%

UniEvo-RS: Omni-Prompt Unified Remote Sensing Segmentation with Representative Exemplar-Driven Prototype Evolution

UniEvo-RS:基于代表性示例驱动原型演化的全提示统一遥感分割

Kunquan Zhang, Peilang Li, Xikun Hu, Yunkai Yang, Yushan Zou, Zhiwei Zhang, Runmin Dong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 UniEvo-RS是配备代表性示例驱动原型演化的全提示统一遥感分割框架,通过多指令提示数据集与原型演化机制,在批量标注中对未见过的类别实现无需训练的精度提升,性能达当前最优。

Comments 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03715 2026-08-05 cs.LG cs.CE 新提交 57%

Amortized Interventional Forecasting for Multivariate CIR Processes

多元CIR过程的摊销干预预测

Andreas Sauter, Sumit Sourabh, Drona Kandhai, Erman Acar

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文针对多元CIR过程,提出摊销干预预测框架CIR-ACTIVA,可估计因果效应、预测多horizon冲击响应,在CDS利差测试中优于基线,能解答观测型方法无法处理的假设性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03655 2026-08-05 cs.CL cs.AI 新提交 57%

Decoupling Generation and Selection for Budget-Constrained Faithful Summarization

面向预算约束的忠实摘要生成:解耦生成与选择

Zeyu Wang, Guanghua Wang, Meng Xu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对摘要式模型的事实不一致等问题,提出解耦生成与选择的模块化框架,在多数据集上提升了事实性,仅参考重叠分数略有降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03581 2026-08-05 cs.CY cs.AI 新提交 57%

AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality

跨研究社区的AI辅助同行评审:从评审人AI政策到大语言模型评审质量

Alexander M. Fichtl, Lukas Ellinger, Josefin Kelber, Kryštof Olík, Georg Groh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究调研111个顶尖AI/NLP会议及医学期刊的AI评审政策,评估ICLR 2026和《自然·通讯》的AI评审质量,发现AI评审存在系统性缺陷,主张采用多维度评估。

Comments 30 pages, 19 figures, 10 tables. Currently under peer review. GitHub link for code and data is given in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02437 2026-08-05 cs.CV 版本更新 57%

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

InfiniSplat:用于大基线单目视图合成的隐式高斯解码

Jiawei Wang, Hao Yu, Yongzhen Hu, Xinyi Yang, Tao Ni, Xin Zhan, Junbo Chen, Xiaowei Zhou, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Shenzhen University(深圳大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 InfiniSplat是一种前馈单图像3DGS框架,通过几何引导采样和查询条件隐式解码器实现表面对齐表示,在跨数据集NVS任务中达SOTA,且具零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 (Journal Track). Code: https://github.com/zju3dv/InfiniSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22882 2026-08-05 cs.CV cs.RO 版本更新 57%

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02598 2026-08-04 cs.CV 新提交 57%

VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification

VR3D:面向空地行人重识别的视角鲁棒3D表示学习

Chao Ji, Shiyu Xuan, Zechao Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文针对空地行人重识别的视角偏差问题,提出VR3D框架,通过视角鲁棒3D表示交互与可靠性感知融合技术,在三个基准数据集上实现了优于现有方法的性能,CARGO数据集Rank-1提升5.63%。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02217 2026-08-04 cs.CV 新提交 57%

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

VC-Tooler:学习组合式与自适应视觉工具使用

Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01977 2026-08-04 cs.CV 新提交 57%

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 57%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01354 2026-08-04 cs.CV 新提交 57%

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练

Yicheng Xiao, Haoxuan Ma, Caorui Li, Yucheng Wu, Weijie Wang, Haoxiao Wang, Shuang Chen, Fan Yang, Haiyun Guo, Jinqiao Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01175 2026-08-04 cs.AI 新提交 57%

The Graph Language: How Knowledge Graphs Speak to Large Language Models

图语言:知识图谱如何与大语言模型对话

Giuseppe Pirrò

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对知识图谱与大语言模型融合的挑战,提出GRALAN模型,通过关系令牌实现KG在LLM语义空间的适配,在问答任务中显著优于现有方法,为KG-LLM融合提供新范式。

Comments Accepted to ISWC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 57%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00009 2026-08-04 cs.CL cs.AI 新提交 57%

AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents

AgentMemBench:用于评估对话AI智能体长期记忆管理策略的系统基准

Ahmed Cherif

机构 * Sofrecom(索弗雷科姆)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究构建了AgentMemBench基准,评估五种记忆策略及两款现有系统,发现外部键值存储(EKV)在长程对话记忆任务中表现最优,但存在内存占用成本,同时公开了全部可复现资源。

Comments 22 pages, 3 figures submitted on Neural Computing and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10485 2026-08-04 cs.AI 版本更新 57%

Panning for Gold: Expanding Domain-Specific Knowledge Graphs with General Knowledge

寻找黄金:利用通用知识图谱扩展领域特定知识图谱

Runhao Zhao, Weixin Zeng, Wentao Zhang, Chong Chen, Zhengpin Li, Xiang Zhao, Lei Chen

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) The Center for machine learning research(机器学习研究中心) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出领域特定知识图谱融合任务,通过神经符号框架ExeFuse,利用通用知识图谱提升领域知识图谱的完整性和实用性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07086 2026-08-04 cs.SE cs.AI cs.CL 版本更新 57%

RAG Strategies for Natural Language-Based SQL Query and REST API Call Generation

评估用于基于自然语言的SQL和API调用生成的检索增强生成变体

Tim Schlippe, Simon Martin, Michael Marketsmüller

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文评估了三种RAG变体在生成SQL和API调用任务中的性能,发现CoRAG在混合文档环境下表现最佳,检索策略设计对自然语言接口至关重要。

Comments preprint of conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20851 2026-08-04 stat.ML cs.LG 版本更新 57%

Beyond Noise: A Hypothesis Testing Approach to Robust Feature Selection

特征胜过噪声:通过基于噪声的假设检验的特征选择技术

Mousam Sinha, Tirtha Sarathi Ghosh, Koushik Biswas, Ridam Pal

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种基于噪声假设检验的特征选择方法,通过非参数自助法建立理论基础,有效提升特征选择的可靠性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28649 2026-08-03 cs.HC cs.AI 新提交 57%

COSI-Lab: Conference Living Lab for Modeling Multi-Perspective Multimodal Social Intention

COSI-Lab:用于建模多视角多模态社会意图的会议生活实验室

Zonghuan Li, Litian Li, Arthur Mercier, Gara Dorta, Balint Dioszegi, Jose Morales-Vargas, Chenxu Hao, Ivan Kondyurin, Vanessa Begemann, Nale Lehmann-Willenbrock, Bernd Dudzik, Saunaq Chakrabarty, Sotiris Vacanas, Laura Cabrera-Quirós, Anne L. J. ter Wal, Vitaliy Popov, Jorge Castro-Godínez, Chirag Raman, Stephanie Tan, Hayley Hung

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 COSI-Lab构建了含32名学者的会议多模态数据集,提出表观意图推理任务及相关标注、分析、基准等贡献,助力智能系统处理主观感知。

详情

展开后加载摘要…

URL PDF HTML 收藏