arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2605.00177 2026-08-03 cs.GR cs.CV 版本更新 57%

FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting

FieryGS: 在真实世界中实现火灾合成的物理集成高斯点云方法

Qianfan Shen, Ningxiao Tao, Qiyu Dai, Tianle Chen, Minghan Qin, Yongjie Zhang, Mengyu Chu, Wenzheng Chen, Baoquan Chen

机构 * School of EECS, Peking University(电子工程系,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) ByteDance Seed(字节跳动种子) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 FieryGS通过整合物理准确的燃烧模拟与渲染,实现真实世界3D场景中逼真的火灾合成,结合多模态大语言模型进行物理材料推理,提升火灾动态的可控性和真实性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28509 2026-07-31 cs.CV 新提交 57%

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

RefCaptioner:多参考图像接地的视频字幕生成

Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang, Qixun Wang, Zhuoran Zhang, Xuanyu Zhu, Weihong Lin, Xinlei Yu, Yujie Wei, Xinwei Long, Fengxiang Wang, Xinlong Chen, Yue Ding, Jialu Chen, Haotian Wang, Yuanxing Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多参考图像接地的视频字幕生成新任务,构建语料库与MRVBench基准,提出RefCaptioner框架,实验证实其性能最优且生成字幕更忠实。

Comments https://github.com/pkucs-Ltf/RefCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28087 2026-07-31 cs.AI 新提交 57%

Diversifying Personalized Research Ideation against AI-Induced Homogenization

针对AI引发的同质化问题实现个性化研究构思的多样化

Rui Xu, Yunke Wang, Linwei Tao, Wenjie Xuan, Yong Luo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对AI辅助研究构思的同质化问题,提出DivAlign四阶段流程,在保留研究者-方向适配性的同时降低社区研究组合冗余,相关成果代码与数据已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27865 2026-07-31 cs.CV 新提交 57%

Learning to Understand Body Language from Flight through Robust 3D Avatar Placing

通过鲁棒3D化身放置学习理解肢体语言

Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

机构 * National University of Science and Technology “Politehnica” Bucharest(布加勒斯特理工国立大学) “Simion Stoilow” Institute of Mathematics of the Romanian Academy(罗马尼亚科学院“西米翁·斯托伊洛夫”数学研究所) NORCE Norwegian Research Centre AS(挪威NORCE研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 该研究推出Drones2BodyLanguage数据集,结合轻量几何世界模型训练12种架构,可提升空中机器人对人类交际意图的感知准确率,为社交智能无人机提供数据支撑与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27537 2026-07-31 cs.CV 新提交 57%

ProgFormer: Hierarchical Voxel Diffusion Transformer for Longitudinal Brain MRI Prediction

ProgFormer:用于纵向脑部MRI预测的分层体素扩散Transformer

Dexuan Ding, Yuankai Qi, Luping Zhou, Jian Yang, Quan Z. Sheng, Ming-Hsuan Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 ProgFormer是一种分层体素扩散Transformer,通过粗-细通路结合条件流匹配,在ADNI等三个基准上实现了更优的纵向脑部MRI预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27450 2026-07-31 cs.LG 新提交 57%

Neural Network-Assisted CLEAN for Channel Modeling in Low-SNR Regimes

低信噪比环境下基于神经网络辅助CLEAN的信道建模

Chaofan Deng, Linyu Sun, Jaeho Lee, Arijit Raychowdhury

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 针对低信噪比信道建模,该研究提出混合框架NN-CLEAN,结合神经网络与CLEAN算法,在5dB SNR下精度超96%,计算复杂度大幅降低,可作为MIMO系统实时信道估计方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27393 2026-07-31 cs.CL cs.AI 新提交 57%

AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes

AHA-Memes:用于理解阿拉伯语表情包中仇恨内容的细粒度多模态基准

Mohamed Bayan Kmainasi, Ali Ezzat Shahroor, Abul Hasnat, Md. Rafiul Biswas, Wajdi Zaghouani, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Northwestern University in Qatar(卡塔尔西北大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 该研究推出首个带细粒度多标签标注的阿拉伯语仇恨表情包基准AHA-Memes,构建含5000张人工标注及6.6万张银标的数据集,对多类模型基准测试并发布资源以推动相关研究。

Comments 26 pages, 14 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10497 2026-07-31 cs.CL cs.AI 版本更新 57%

Hallucinations and Truth: A Comprehensive Accuracy Evaluation of RAG, LoRA and DoRA

幻觉与真相:RAG、LoRA和DoRA的综合准确率评估

Mohammad Baqar, Rajat Khanda

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文评估RAG、LoRA、DoRA在2万条FAQ查询、40万条知识库上的性能,发现DoRA准确率90.1%、相关性0.88、延迟110毫秒最优,为高准确率领域部署生成式AI提供指导。

Comments 10 Pages

Journal ref 2026 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS), 10.1109/FLICS70075.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26567 2026-07-30 cs.RO cs.CV 新提交 57%

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

Speech2Grasp:面向人形机器人的文本条件抓取检测到语音的高效数据迁移

Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu, Van-Danh Le, Hoang Huy Le, Dinh Tuan Nguyen, Pham Tuyen Le, Van-Truong Nguyen, Quan Nguyen

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出Speech2Grasp框架,以数据高效方式将文本条件抓取检测模型迁移至语音输入,通过轻量级MLP投影器适配,在人形机器人实验中性能优于级联ASR流水线且延迟更低,为文本系统扩展到语音提供实用范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26395 2026-07-30 cs.CV 新提交 57%

Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation

基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割

Pengyu Jie, Wanquan Liu, Rui He, Pengcheng Li, Weiping Wen, Deyu Meng, Junwei Han, Chenqiang Gao

机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26067 2026-07-30 cs.CY cs.AI 新提交 57%

The Easy Trap: Why LLMs Underestimate Misconception-Driven Difficulty

易陷阱:为何大语言模型低估由误解驱动的难度

Amanda La Hadi, Muhammad Johan Alibasa, Guanliang Chen, A. Taufiq Asyhari

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。

Comments This paper poster presented on 19th Educational Data Mining Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04171 2026-07-30 cs.RO cs.LG 版本更新 57%

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11178 2026-07-30 cs.AI cs.CL cs.MM cs.SI 版本更新 57%

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

TANDEM: 面向多模态仇恨言论的时间感知神经检测

Girish A. Koushik, Helen Treharne, Diptesh Kanojia

机构 * Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系) Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出TANDEM统一框架,通过串联强化学习策略联合优化视觉-语言和音频-语言模型,将音频-视觉仇恨检测转化为结构化推理问题,在HateMM上目标识别F1达0.73(提升30%),并保持精确时间定位。

Comments Accepted to AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10605 2026-07-30 stat.ML cs.CY cs.LG econ.EM stat.ME 版本更新 57%

Optimal Causal Annotations: An Application to Casenotes in Social Services

批量自适应因果标注

Ezinne Nwankwo, Lauri Goldkind, Angela Zhou

机构 * UC Berkeley(加州大学伯克利分校) Fordham University(福特汉姆大学) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出一种批量自适应方法,通过优化数据采样策略提高因果效应估计效率,减少标注成本,实验证明在缺失数据下能显著降低均方误差。

Comments Extended journal version. A preliminary version was accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15336 2026-07-30 cs.HC cs.AI 版本更新 57%

Facial-Expression-Aware Prompting for Empathetic LLM Tutoring

面向情感的提示方法用于共情LLM辅导

Shuangquan Feng, Laura Fleig, Ruisen Tu, Philip Chi, Edmund Bu, Melinda Ozel, Junhua Ma, Teng Fei, Virginia R. de Sa

机构 * Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系) Face the FACS Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究了在LLM辅导中整合面部表情信号以提升共情响应的效果,通过四种不同方法对比发现,基于动作单元的条件化能提升对面部表情的共情响应,而引导峰值帧选择优于随机帧输入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01008 2026-07-30 cs.CV 版本更新 57%

LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency

LISA-3D: 通过多视角一致性将语言-图像分割提升至3D

Zhongbin Guo, Jiahe Liu, Wenyu Gao, Yushan Li, Xiaomin He, Chengzhi Li, Ping Jian

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LISA-3D通过多视角一致性将语言-图像分割提升至3D,提升语言到3D的准确性达15.6个点,仅需11.6M参数,支持零样本部署。

Comments Published as a conference paper at The 9th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25853 2026-07-29 cs.AI 新提交 57%

HiSkill: Empowering LLM Agents with Hierarchical Skill Graphs

HiSkill:利用分层技能图增强大语言模型智能体

Yu Hao, Jinxuan Cai, Qi Zhang, Yawen Li, Zhiqiang Zhang, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Mobile Group Shaanxi Co., Ltd(中国移动通信集团陕西有限公司) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究提出HiSkill分层技能图框架,将交互轨迹组织成有向图,连接高级技能与可执行动作模板并捕捉多种关系。推理时检索子图引导任务执行,实验表明其在减少推理令牌消耗方面优于基线,有效弥合技能与动作差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25620 2026-07-29 cs.AI cs.HC 新提交 57%

Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

超越认知:认知分裂症与作为技术符号机器的大语言模型

Federico Cabitza, Gianluca Colombo

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25239 2026-07-29 cs.CV 新提交 57%

CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking

CD-RMOT-Bench:跨域引用多目标跟踪基准测试

Xiangqun Zhang, Likai Wang, Zekun Qian, Ruize Han, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳先进技术大学计算机科学与人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究跨域引用多目标跟踪(CD-RMOT)问题,构建CD-RMOT-Bench基准并提供QCA框架,实验发现域转移严重影响RMOT性能,QCA建立基线,CD-RMOT-Bench为跨视觉域的鲁棒语言引导跟踪开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24772 2026-07-29 cs.AI cs.CL 新提交 57%

RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation

RSMeM:用于遥感智能体的知识增强记忆进化及系统评估

Bingxian Wu, Yu Zhang, Zonghao Guo, Tang Liu, Chen Qian, Yuxiang Lu, Xingbo Du, Yanghao Li, Yidan Zhang, Chi Chen, Ling Yao, Maosong Sun

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有遥感智能体问题,提出RSMeM机制,通过分层知识基础和失败感知经验提炼两个组件,迭代吸收领域知识转化为执行经验,经实验验证能提升工具使用性能和答案质量,具有强大知识密度。

Comments Accepted to ACL 2026 Main. Code: https://github.com/AI9Stars/RSMeM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02902 2026-07-29 cs.AI 57%

Minimal Computational Preconditions for Subjective Perspective in Artificial Agents

人工代理主观视角的最小计算前提

Hongju Pae

机构 * Hongju Pae 1

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过最小内部结构实现人工代理的主观视角,揭示了滞后效应作为衡量机器系统主观性的标志。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24449 2026-07-28 cs.IR cs.AI 新提交 57%

Evaluating RAG for French immigration law: a benchmark and baseline study

评估法国移民法的RAG:一项基准和基线研究

Annia Abtout, Julien Delaunay, Monika Ewa Rakoczy

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究法国国际招聘的法律框架,通过公开基准比较参数化语言模型基线与密集检索增强在两种模型规模下对52个合成档案的效果,发现检索能改进行政指导,凸显检索基础的重要性,推动混合检索策略研究。

Journal ref International workshop on AI for Human Resources and Public Employment Services (ECML-PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24280 2026-07-28 cs.AI 新提交 57%

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

从专有模型到开源模型:通过智能体搜索中的多智能体协议蒸馏弥合分布差距

Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou

机构 * Beijing Institute of Technology(北京理工大学) East China Normal University(华东师范大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究旨在弥合专有与开源模型分布差距,提出多智能体协议蒸馏(MAPD)框架,利用结构化协议作中间表示,结合蒸馏与强化学习,在问答基准测试中表现出色,有效减轻学生策略问题,优于其他竞争方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24097 2026-07-28 cs.AI 新提交 57%

MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents

MemChain:为内存增强型大语言模型智能体学习可解释的内存痕迹

Yiwen Ma, Songjun Tu, Qichao Zhang, Dong Li, Linjing Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Memorax AI(Memorax人工智能公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对内存增强型大语言模型智能体检索内存回答查询存在的问题,提出MemChain可训练检索后内存策略,经两阶段学习框架训练,能生成有效证据上下文,实验证明其在多种模型上性能领先且减少内存上下文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24006 2026-07-28 cs.CR cs.AI cs.DC 新提交 57%

Agentic Cloud Decoys: A Deception-Driven Framework for Autonomous Intrusion Investigation

智能云诱饵:一种用于自主入侵调查的欺骗驱动框架

Mohan Manivannan, Dalal Alharthi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对云遥测使入侵理解困难的问题,提出云诱饵人工智能代理框架,通过会话聚合运算符、动态提示生成等方法,在十个AWS S3场景测试中效果良好,能压缩调查路径,多数场景可完全重建,且延迟短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23242 2026-07-28 cs.CL cs.LG 新提交 57%

IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages

IndicTalk:用于印度语言的大规模基于角色的多语言对话语料库

Sahil Deepak Gawande, Mayank Singh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 针对印度语言高质量多语言代码混合对话资源稀缺问题,提出通过全自动管道生成IndicTalk语料库,涵盖多种印度语言变体,经多种评估表现良好,将发布该语料库支持相关人工智能开发评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22706 2026-07-28 cs.AI cs.DL cs.IR 新提交 57%

MPR-CiteG: Enhancing RAG with Multi-Portfolio Retrieval and Citation-Grounded Generation

MPR-CiteG:通过多组合检索和引用基础生成增强RAG

Hyewon Lee, Minkyung Song, Junghyun Oh, Seunghoon Han, Sungsu Lim

机构 * Chungnam National University(忠南国立大学) Data Intelligence Laboratory(数据智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对生成式AI检索低效与缺来源验证问题,提出双组件MPR-CiteG框架,用多组合检索器高效检索,引用基础生成模块确保输出事实一致且有源可溯,经实验验证其有效性与可靠性,助力构建更可信准确的大语言模型。

Comments 12 pages, 1 figure, 7 tables. The 1st International Workshop on Retrieval-Driven Generative AI & ScienceON AI Challenge 2025@CIKM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22566 2026-07-28 cs.AI 新提交 57%

MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models

MedLoCoMo:用于大语言模型的长上下文多会话医学对话基准

Zeyu Zhang, Ziqing Wang, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对大语言模型在多入院医学对话临床推理方面的不足,构建MedLoCoMo基准,通过特定方法生成问答项目,含100个患者时间线,发现跨入院推理比局部证据使用难,提供代码和基准供使用与复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13653 2026-07-28 cs.CV cs.RO 版本更新 57%

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03367 2026-07-28 cs.AI 57%

CLMASP: Coupling Large Language Models with Answer Set Programming for Robotic Task Planning

CLMASP:将大语言模型与答案集编程耦合用于机器人任务规划

Xinrui Lin, Yangfan Wu, Huanyu Yang, Yu Zhang, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出CLMASP方法,结合大语言模型和答案集编程,解决机器人任务规划中计划落地问题,实验显示其执行率显著提升。

Comments 9 pages, accepted to IJCAI 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏