Privately Customizing Prefinetuning to Better Match User Data in Federated Learning
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG
DiffCoT:在大语言模型中采用扩散风格的推理链推理
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
AI总结 DiffCoT通过扩散风格的推理链框架,改进了大语言模型在多步数学问题解决中的鲁棒性和错误纠正能力,通过迭代去噪过程实现中间步骤的统一生成与回顾性修正。
Comments DiffCoT improves multi-step LLM reasoning by applying diffusion-based iterative denoising to correct intermediate Chain-of-Thought steps
Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026
TS-Agent:通过迭代洞察获取理解并推理原始时间序列
机构 * JPMorgan AI Research, NY, USA(摩根大通人工智能研究院,纽约,美国)
专题命中 推理与问题求解 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.AI
AI总结 TS-Agent通过迭代洞察获取机制,在时间序列理解和推理任务中匹配或超越文本、视觉及时间序列语言模型基线,尤其在零样本设置下表现更优。
Comments NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models
推理在3D视觉定位中至关重要
机构 * University of Washington(华盛顿大学)
专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种自动合成3D视觉定位数据的管道,并引入了在仅使用1.6%训练数据下表现优于现有方法的Reason3DVG-8B模型,证明了推理在3D视觉定位中的重要性。
Comments 2025 CVPR Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments
机构 * University of Southern California(南加州大学)
专题命中 推理与问题求解 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.LG
Comments 7 pages, 3 figures, In Proceedings of the 1st ACM SIGPLAN International Workshop on Language Models and Programming Languages (LMPL'25), October 12-18, 2025, Singapore, Singapore. ACM, New York, NY, USA
机构 * Instituto Tecnológico de Castilla y León(卡斯蒂利亚-莱昂技术学院)
专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.AI
Comments 11 pages, includes 3 tables summarizing schema and model performance. Submitted on July 31, 2025. Targets integration of LLM agents with ERP systems using open-weight models and Ollama deployment
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments The paper has been accepted for presentation at CVPR 2024 Workshop on Prompting in Vision
专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL
Comments work in progress; efficient 7B LLM-based agent
Lark:生物启发的多利益相关者大语言模型代理神经进化
专题命中 推理与问题求解 :LLM(title,abstract)
AI总结 Lark通过结合大语言模型推理与进化型多智能体系统,解决冗余与利益相关者权衡问题,采用四机制提升策略生成效率与透明度,实验显示其在30轮评估中表现优异且成本可控。
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Efficient Reasoning
DoublesEval:通过专业双打羽毛球诊断视觉语言模型的多智能体战术推理能力
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; University of Macau(澳门大学)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 本研究提出DoublesEval框架,以专业双打羽毛球为测试平台评估VLMs的多智能体战术推理能力,发现现有模型存在明显瓶颈,所提TacticCheck可提升模型表现但仍有差距,强调需改进VLMs的评估范式。
Comments Accepted by BMVC2026
用于可解释人脸识别的视觉语言模型融合
机构 * Hochschule Darmstadt(达姆施塔特应用科学大学)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 本研究提出多视觉语言模型(VLM)融合框架,结合相似度分数、文本解释与人脸图像,提升了人脸识别准确率,同时生成更丰富稳健的可解释决策,助力开发负责任的可解释人脸识别系统。
WADE:面向紧凑视觉-语言模型的多实例漂浮垃圾定位推理标注基准
机构 * United International University(联合国际大学)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 针对内陆漂浮垃圾监测需求,研究推出WADE基准并评估6种VLMs,微调Qwen3-VL-2B可提升性能但仍有大量实例未被检测,为紧凑VLMs的漂浮垃圾定位提供挑战基准。
机器人中的基础模型:方法、模型、数据集、挑战及未来研究方向的全面综述
机构 * Department of Informatics and Telematics, Harokopio University of Athens(信息与电信系,哈罗科比欧大学)
专题命中 推理与问题求解 :foundation model(title,abstract)
AI总结 本文综述了机器人中基础模型的发展,涵盖方法、模型、数据集、挑战及未来方向,分析了不同阶段的研究演变及关键方面。
Journal ref Transactions on Machine Learning Research (TMLR), 07/2026
AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。
CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练
机构 * University of Moratuwa(莫拉图瓦大学) ; Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) ; Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))
专题命中 推理与问题求解 :pretraining(title);language model(abstract)
AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。
Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)
聚焦推理:面向视觉语言模型的有状态、基于动作的视觉聚焦
机构 * AI Center -- Mountain View, Samsung Electronics(三星电子山景城人工智能中心)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 本文提出Foveated Reasoner,通过整合聚焦与推理机制,提升视觉语言模型在高分辨率图像下的效率与准确性,实验证明其在多种基准测试中表现优异。
Comments ECCV 2026
PDDL-ART:基于演示的自主符号抽象方法,用于使用视觉语言模型的长时程机器人操纵
机构 * University of Michigan(密歇根大学)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 PDDL-ART是一种基于VLM的框架,可自主从演示生成PDDL描述,经多阶段校正确保语义对齐,在发动机维护和家庭操纵任务上平均成功率达93.3%,优于基线规划器。
关键在于提示:用于肺结节分割的基础模型中的提示敏感性与提示生成
专题命中 推理与问题求解 :foundation model(title,abstract)
AI总结 本研究针对肺结节分割的基础模型,分析其对提示的敏感性,提出合成提示生成模型,实验显示该方法戴斯系数达0.85,为相关分割提供了有前景的策略。
I-Perceive:一种基于语言指令的主动感知基础模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; Beihang University(北京航空航天大学)
专题命中 推理与问题求解 :foundation model(title,abstract)
AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。
基础模型时代中的具身机器人操作:规划与学习视角
机构 * Xi’an Jiaotong Univeristy(西安交通大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Chinese Academy of Sciences(中国科学院) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; University of Sydney(悉尼大学) ; BAAI(百度人工智能研究院) ; Peking University(北京大学)
专题命中 推理与问题求解 :foundation model(title,abstract)
AI总结 本文探讨了基础模型时代机器人操作的规划与学习方法,分析了高层推理与低层控制的统一框架,并提出了未来研究方向。
Comments This work is a re-architected core derived from the full survey (arXiv:2510.10903), refined to highlight the most central themes and representative studies
空间思维链:面向视觉语言模型的模态无关空间定位
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。
ComplexityWorld:面向可验证视觉决策的视觉语言模型基准测试
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 该研究推出COMPLEXITYWORLD基准测试VLMs在可验证视觉决策任务上的表现,发现多数模型在直接推理下验证器接受率不足40%,且存在视觉到决策的瓶颈。
Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。
用于通用符号推理的递归视觉语言模型
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。
RynnBrain 1.1:迈向更具能力和通用性的具身基础模型
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(湖畔实验室)
专题命中 推理与问题求解 :foundation model(title,abstract)
AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。
Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11
PixDLM:一种用于无人机推理分割的双路径多模态语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。
Comments Accepted to CVPR 2026 (highlight)
GeoThreat:用于遥感图像解释的大型视觉语言模型的可转移目标对抗攻击
机构 * Department of Mathematics, Hong Kong Baptist University(香港浸会大学数学系) ; School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 研究针对大型视觉语言模型在遥感图像解释中的对抗攻击问题,提出GeoThreat方法,通过在概念和感知层面调制对抗表示,结合对抗目标相似性梯度等技术,实现可转移目标对抗攻击,实验证明该方法在可转移性和可控性上具有优越性。
Comments The code will be released at https://github.com/fuyimin96/GeoThreat upon acceptance
LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 推理与问题求解 :LLM(title,abstract)
AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。
Aircast-Mars:一种用于全球天气预报的火星基础模型,采用HEALPix感知卷积
专题命中 推理与问题求解 :foundation model(title,abstract)
AI总结 研究针对火星天气预报,提出基于EMARS v1.0训练的Aircast-Mars系统。采用HEALPix感知二维U-Net架构,结合自定义填充和ConvNeXt残差块。该模型参数少、速度快,验证MSE低,能稳定递归预测,为行星尺度天气预报提供了基础。
何时信任地图:用于汽车CVE到ATM映射的置信度感知大语言模型路由
专题命中 推理与问题求解 :LLM(title,abstract)
AI总结 研究汽车CVE到ATM映射问题,提出通过分层上下文学习生成候选映射,融合多种信号到校准元模型,以校准置信度分数分类候选映射,在评估集上显著提高精度,支持选择性自动化。
Comments 11 pages, 2 figures, 3 tables; Accepted at ESCAR EUROPE 2026