Quasar: A Programming Language Specialized for LLM Code Actions
Quasar:一种专门用于LLM代码操作的编程语言
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出专门用于LLM代码操作的编程语言Quasar,通过分离内部代码与外部调用实现新特性,还实现了访问控制、自动并行化、共形预测等增强代码操作的特性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
Quasar:一种专门用于LLM代码操作的编程语言
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出专门用于LLM代码操作的编程语言Quasar,通过分离内部代码与外部调用实现新特性,还实现了访问控制、自动并行化、共形预测等增强代码操作的特性。
视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力
专题命中 视觉推理 :VLM(title,summary_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。
Comments Accepted at EMNLP 2026 (Findings)
MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)
AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
TangramPuzzle: 通过组合空间推理评估多模态大语言模型
机构 * Tsinghua University(清华大学) ; Sun-Yat Sen University(孙逸人大学) ; Tencent Youtu Lab(腾讯优图实验室) ; University of Illinois Chicago(伊利诺伊大学香槟分校)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。
Comments EMNLP 2026 Findings
空间-DisE:评估视觉语言模型空间推理能力的统一基准
机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)
专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.CV
AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。
Comments ICLR 2026 Accepted Project Page: this https URL (https://shinmohuang.github.io/spatialdise_page/)
ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试
机构 * International Digital Economy Academy(国际数字经济学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。
Comments Accepted to EMNLP 2026 (Main Conference)
超越视频:统一视频推理与深度研究的开放世界视频智能体
机构 * Shandong University(山东大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北京航空航天大学) ; City University of Hong Kong(香港城市大学) ; Nanyang Technological University(南洋理工大学) ; Kuaishou Technology(快手科技) ; Southern University of Science and Technology(南方科技大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。
整合时空模型与大语言模型(LLMs)的模块化多任务推理框架
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) ; Institute for Infocomm Research, A*STAR, Singapore(资讯通信研究院) ; School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出整合时空模型与LLMs的STReason框架,通过上下文学习分解查询生成解释,在时空推理任务中显著优于LLM基线,可抑制幻觉并减少专家工作量。
SPAR-Hate:一种由审核员引导的用于双语仇恨言论解析的多智能体框架
机构 * Dalian University of Technology(大连理工大学) ; Inner Mongolia University(内蒙古大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 针对结构化仇恨言论解析的文化等挑战,提出SPAR-Hate多智能体框架,分解文档为决策单元后从三视角生成判断并仲裁,在基准上实现双语仇恨解析最优结果。
Comments 16 pages, 2 figures. Submitted to EMNLP 2026
Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏
机构 * Xi’an Jiaotong University(西安交通大学) ; MOE KLINNS Lab(MOE KLINNS实验室) ; Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) ; Sun Yat-sen University(中山大学)
专题命中 视觉推理 :VLM(abstract_cn);分类 cs.CV
AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。
一个用于高级多模态个性化研究的基准和知识引导框架
机构 * Google(谷歌) ; DeepMind(深Mind)
专题命中 视觉推理 :vision language model(abstract);分类 cs.CV
AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。
LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解
机构 * Case Western Reserve University(凯斯西储大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。
Comments Camera-ready version, accepted at NeuS 2026
有何玄机?评估视觉-语言模型的时间一致性
机构 * University of Copenhagen(哥本哈根大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出TimeCatch基准,发现视觉-语言模型可检测单帧异常但难整合跨帧信息,在时间异常检测上表现接近随机水平。
Comments 17 pages, ACL format
超越表象:揭示多模态大语言模型的情境错觉
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。
Comments 9 pages, 5 figures
ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地
机构 * InspireOmni AI ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。
从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。
Comments 19 pages, 10 figures
比较解释并不足够,解释变化:需要新的标准来解释大型语言模型中的行为转变
机构 * Scuola Normale Superiore(诺莱学院) ; ISTI-CNR(意大利国家研究委员会ISTI研究所) ; University of Pisa(比萨大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种新的XAI方法,旨在解释大型语言模型在干预后行为转变的原因和机制,以应对现有解释方法无法解释行为转变的问题。
ICA: 信息感知的信用分配用于基于视觉的长周期信息寻求智能体
机构 * Shanghai Jiao Tong University(上海交通大学) ; ShanghaiTech University(上海科技大学) ; Wuhan University(武汉大学) ; SenseTime Research(商汤科技研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ICA方法,通过视觉快照和信息层面信用分配,提升开放网络环境中信息寻求智能体的性能。
Comments Accepted to the Main Conference of EMNLP 2026
MediSkill-Evo:面向证据依据的临床交互的过程约束自进化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。
分子大语言模型智能体:从架构设计到科学自主性
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。
Comments 25pages
寻找黄金:利用通用知识图谱扩展领域特定知识图谱
机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) ; National University of Defense Technology(国防科技大学) ; The Center for machine learning research(机器学习研究中心) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出领域特定知识图谱融合任务,通过神经符号框架ExeFuse,利用通用知识图谱提升领域知识图谱的完整性和实用性。
Comments 13 pages, 5 figures
内部稳定,跨样本未识别:基准效应与排名的语义识别
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 该研究针对TraceElephant基准,揭示评估语义对结论的影响,通过分析F_asym、F_cc等的效应与排名,提出局部非蕴含见证及族索引审计方法。
Comments 31 pages; major revision; adds a commit-bound 124-unit Inspect Evals census, typed evidence-stopping taxonomy, executable claim-replay contract, full scientific appendix, and public reproducibility package
ConstructCIE:用于从施工事故叙述中提取因果信息的数据集
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。
Comments Paper accepted by EMNLP 2026 Findings
基于检索的多语言LLM辅助工具用于岛屿小农户
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。
Comments 13, 4
双图之 tale:分离知识探索与大纲结构以实现开放性深度研究
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出DualGraph架构,通过分离知识与写作结构,提升开放性深度研究的效率和深度,实验表明其在报告深度、广度和事实准确性上优于现有方法。
Comments 26 pages, 4 figures
通过无训练KV缓存压缩实现高效的长周期GUI代理
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。
Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages
VLANeXt: 构建强大VLA模型的配方
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; SenseTime Research(商汤科技研究院) ; Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。
Comments Accepted in ICML 2026, Project Page: this https URL (https://dravenalg.github.io/VLANeXt/)
面向VLM-as-a-Judge评估的视障辅助基准
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 幻觉与鲁棒性 :VLM(title,title_cn);分类 cs.CV
AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。
Comments Accepted to EMNLP 2026 (Main Conference)
看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见
机构 * Zhejiang University(浙江大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。