Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
专题命中 视觉定位与Grounding :MLLM(abstract,comments);grounding(abstract);分类 cs.CV
Comments NeurIPS 2024 (Oral). Website at https://cambrian-mllm.github.io
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :MLLM(abstract,comments);grounding(abstract);分类 cs.CV
Comments NeurIPS 2024 (Oral). Website at https://cambrian-mllm.github.io
将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。
Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026
PhysCaP:基于物理引导探索的代码即策略智能体
机构 * National Taiwan University(台湾大学) ; NVIDIA Research(英伟达研究院) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 PhysCaP是一种带物理引导探索层的代码即策略智能体,采用双智能体设计,可高效估算物体物理属性,在桌面操纵及LIBERO模拟任务中性能优于基线方法。
将正念建立在具身实体之上:面向人机交互设计的范围综述与理论框架
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本研究通过对65项正念实体设备的HCI范围综述,提出基于S-ART框架的理论及ESE、ESA模型,为HCI中正念技术的设计、评估及未来研究提供原则性基础。
CodeOCR: 关于视觉语言模型在代码理解中的有效性
机构 * Shanghai Jiao Tong University China ; Hohai University China ; Singapore Management University Singapore ; Imperial College London United Kingdom ; East China Normal University \& Shanghai Innovation Institute China ; Chongqing University China ; Shanghai Jiao Tong University ; Hohai University ; Singapore Management University ; Imperial College London ; East China Normal University \& Shanghai Innovation Institute ; Chongqing University
专题命中 视觉定位与Grounding :vision language model(title)
AI总结 本文探讨多模态大语言模型在代码理解中的有效性,发现其可通过图像压缩显著提升效率,并在代码克隆检测等任务中表现出更强的抗压缩能力。
Comments ISSTA 2026 camera ready. Code and data are available at https://github.com/YerbaPage/CodeOCR
无免费标签:缺乏人类基准的LLM作为评判的局限性
机构 * Kensho Technologies ; MIT(麻省理工学院)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。
GARDRec:面向大语言模型推荐的决策级图接地方法
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。
Comments 18 pages, 2 figures
KAMR:基于知识对齐多跳检索的接地生成
专题命中 视觉定位与Grounding :grounding(title)
AI总结 该研究针对多跳检索中三元组排序与监督缺失问题,提出KAMR知识对齐多跳检索器,通过构建部分对齐数据集优化对比目标,在多基准与LLM主干上提升了多跳检索和下游问答性能。
Comments Accepted by COLM'26
惊奇理论是同义反复的(缺乏理性基础)
机构 * ETH Zürich(苏黎世联邦理工学院)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 研究惊奇理论,指出其在无额外约束时是同义反复,任何难度模式都与某语言模型一致,无法证伪。长期被隐含假设掩盖,近期实证削弱该假设。结论是打破同义反复需理性主义干预,相关语言模型应源自非经验驱动模型。
Comments Under "Review" at ARR
RuleChef:将LLM任务知识扎根于可人工编辑的规则
机构 * KR Labs(KR实验室) ; TU Wien(维也纳工业大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。
Comments 8 pages
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
机构 * KR Labs(KR实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; McGill University(麦吉尔大学) ; TU Wien(维也纳工业大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。
Comments 8 pages
将生成式策略基于物理:面向机器人控制的优化引导扩散
机构 * ETH Zurich(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 提出推理时优化框架,通过将扩散引导建模为约束优化问题,在采样中施加物理可行性约束,无需重训练即可提升机器人任务成功率。
通过说话人日志条件将口语大语言模型扩展到多说话人音频
专题命中 视觉定位与Grounding :grounding(title)
AI总结 提出基于说话人日志条件的口语语言模型,通过条件化声学编码器提取目标说话人表示,避免序列化输出训练导致的灾难性遗忘,在多个数据集上显著提升说话人属性转录性能。
Comments Accepted to Interspeech 2026
VRA:在电压受限致动器中接地离散时间联合加速度
机构 * Department of Mechanical and Automation Engineering(机械与自动化工程系) ; Hong Kong Embodied AI Lab(香港具身AI实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出VRA方法,通过将运动学加速度与电压受限致动器物理相联系,解决在电压受限情况下不可实现的加速度问题,实验表明该方法能消除不可实现的加速度,恢复一致的近约束执行并减少约束引起的振荡。
Comments 10 pages, Accepted by RSS 2026
它会流行吗?基于开放网络的微视频流行度预测
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出了一种基于开放网络的微视频流行度预测方法,通过引入实时开放网络上下文来提升预测准确性,展示了WEBSHORTS数据集和SHORTS-CAST框架在预测微视频流行度方面的有效性。
Comments Working Progress
接触导向策略:具备生成接触基础的灵活视觉-触觉策略
机构 * Purdue University(普渡大学) ; Meta Reality Labs Research(Meta现实实验室) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出Contact-Grounded Policy,通过预测机器人状态和触觉反馈的耦合轨迹,生成接触基础的灵活视觉-触觉策略,优于现有基线方法。
从语音到空间:利用增强现实进行共享视图中话语的定位
机构 * Center for Visual Computing, Stony Brook University(石溪大学视觉计算中心)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出Speech-to-Spatial框架,通过语音指令生成空间定位的AR指导,无需额外线索或人工标注,提升任务效率和可用性。
Comments 11 pages, 6 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR) 2026
代理Jackal:用于文本到JQL的实时执行与语义价值接地
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出Jackal基准,通过实时执行和语义检索工具提升文本到JQL的准确性,验证了代理方法在解决语义歧义中的有效性。
从感知流中对大语言模型进行时空 grounding
机构 * Toyota Motor North America Research & Development(丰田北美研发中心)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出FESTS框架,通过将自然语言查询转化为SpRE,为大语言模型注入可验证的时空监督,提升时空推理能力,使30亿参数模型在27k数据上实现87.5%的帧级F1分数,接近GPT-4.1性能。
将教育中的AI发展扎根于教师的声音:来自印度尼西亚全国调查的结果
机构 * Quantic School of Business and Technology(昆蒂克商业与技术学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Indonesia University of Education(印度尼西亚教育大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 研究通过全国性调查揭示印尼教师对AI在教育中的应用现状,发现AI在教学、内容开发和教学媒体中日益普及,但应用不均,教师更倾向于利用AI减轻教学准备负担。
VoxAnchor:通过毫米波雷达接地语音真实性 via 喉部振动
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出VoxAnchor系统,通过毫米波雷达捕捉喉部振动,结合语音声学与雷达信号,实现细粒度语音真实性验证,有效检测编辑、拼接等伪造手段。
以多哈历史词典为基础 grounding Arabic LLMs:检索增强的古兰经和圣训理解
机构 * College of Islamic Studies, Hamad bin Khalifa University(哈马德·本·哈利法大学伊斯兰学院)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出基于多哈历史词典的检索增强生成框架,提升阿拉伯语LLM对历史宗教文本的理解能力,实验表明在Fanar和ALLaM模型上准确率超过85%。
TxSum: 基于微粒语义锚定的用户导向以太坊交易理解
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Wuhan University(武汉大学) ; University of North Texas(北卡罗来纳州立大学) ; Fudan University(复旦大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。
PaperTrail: 一种用于在基于大语言模型的学术问答中建立溯源的声明-证据接口
机构 * University of Minnesota(明尼苏达大学) ; NASA Langley Research Center(NASA兰利研究中心)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 PaperTrail通过分解LLM回答和源文档为声明与证据,帮助学术领域更严谨地验证LLM的可信度,并揭示其信任worthiness。
Comments 25 pages, 3 figures. Accepted at the ACM CHI conference on Human Factors in Computing Systems 2026
从文本创作到思维创作:将AI写作支持 grounded 到写作中心教学法
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出Writor工具,旨在通过目标设定、平衡反馈和对话来支持写作,而非直接生成文本,以促进学生批判性思维和保留其声音。
Comments Conditionally accepted to CHI 26
通过数据驱动的自我解释实现自然语言到SQL翻译
机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出CycleSQL框架,通过数据驱动的自我解释提升自然语言到SQL翻译的准确性和可解释性。
Comments ICDE2025
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; Peking University(北京大学)
专题命中 视觉定位与Grounding :grounding(title)
Comments Under review
机构 * University of Groningen, The Netherlands(Groningen大学,荷兰)
专题命中 视觉定位与Grounding :multimodal large language model(title)
专题命中 视觉定位与Grounding :grounding(title)
Comments Chapter draft for the Blackwell Companion to the Philosophy and the Multiverse
机构 * Algoverse AI Research(Algoverse AI研究院)
专题命中 视觉定位与Grounding :multimodal large language model(title)
Comments Published at ACL 2025 SRW, 9 pages, 3 figures