Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications
Yuan3.0 Flash:面向企业应用的开源多模态大语言模型
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 Yuan3.0 Flash通过RAPO算法提升企业任务性能,实现高效多模态大语言模型开源
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
Yuan3.0 Flash:面向企业应用的开源多模态大语言模型
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 Yuan3.0 Flash通过RAPO算法提升企业任务性能,实现高效多模态大语言模型开源
增强大语言模型在时序点过程中的时间感知能力
机构 * School of Computer Science and Technology, Tongji University, Shanghai 201804, China(计算机科学与技术学院,同济大学) ; College of Cyber Security, Jinan University, Guangzhou 510632, China(网络安全学院,暨南大学) ; Department of Computer Science, University of Illinois Chicago, Chicago, USA(计算机科学系,伊利诺伊大学芝加哥分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 TPP-TAL通过增强LLMs的时间感知能力,改进了时序点过程中的时间似然估计和事件预测准确性。
Comments preprint
BALI: 基于分支的循环不变式推断与大语言模型
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 BALI通过结合大语言模型和分支感知分析,提升循环不变式的推断和验证精度,实现更高效和自动化的不变式发现。
Comments 4 pages, 1 figure, AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification
TraveLLaMA: 一种基于大规模数据集和结构化推理的多模态旅行助手
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 TraveLLaMA通过结构化推理框架和大规模数据集,提升旅行推荐和场景理解能力,实现用户满意度和系统性能的显著提升。
Comments AAAI 2026 Oral
CSCBench: 一种用于商品供应链推理的PVC诊断基准
机构 * Xiamen SmartChain Innovations Co., Ltd.(厦门智能链创新有限公司) ; Xiamen ITG Digital Technology Co., Ltd.(厦门ITG数字科技有限公司) ; Xiamen C&D Co., Ltd.(厦门C&D有限公司) ; Xiamen Xiangyu Co., Ltd.(厦门翔宇有限公司)
专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL
AI总结 CSCBench通过PVC 3D评估框架,为商品供应链推理提供诊断基准,评估LLMs在过程、品种和认知轴上的表现,发现其在品种轴上尤其存在显著下降。
从情绪分类到情绪推理:提升大语言模型情感智能
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文通过合成情绪链式思维数据提升大语言模型的情感推理能力,实验表明微调后模型在情绪理解与意识评估上显著提升。
Comments 10 pages, 1 figure
推理路径分歧:一种新的度量和筛选策略,以解锁LLM多样化思考
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of Science and Technology of China(中国科学技术大学) ; The University of Hong Kong(香港大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出了一种新的训练范式1PNS和度量RPD,通过增加推理多样性提升LLM的推理能力。
Aletheia: 通过正则化逆混淆矩阵量化推理模型中的认知信念
机构 * Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Aletheia通过正则化逆混淆矩阵量化推理模型中的认知信念,探索AI科学诚信的测量方法。
Comments 6 pages, 2 figures
扩大开放性推理以预测未来
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Tübingen AI Center(图宾根人工智能中心) ; University of Tübingen(图宾根大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种基于开放性推理的预测系统,通过合成全球事件问题并训练专用模型,提升了预测的准确性、校准性和一致性,并开源所有资源促进研究。
Comments 45 pages
LTLBench: 为评估大语言模型中的时间推理能力而设计的基准测试
机构 * University of Edinburgh(爱丁堡大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 LTLBench通过线性时序逻辑评估大语言模型的时间推理能力,构建包含2000个挑战的数据集并测试12个模型,揭示时间推理中的主要问题及复杂性影响。
AHA: 通过反事实硬负样本对齐大音频-语言模型以缓解推理幻觉
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆斯大学) ; Washington University in St.Louis(圣路易斯华盛顿大学) ; Rice University(Rice 大学) ; Morgan Stanley(摩根大通)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 AHA通过反事实硬负样本对齐大音频-语言模型,有效减少推理幻觉,提升时间推理能力,并在多个基准测试中取得显著成效。
医学推理模型中答案格式的鲁棒性研究
机构 * SCB 10X R&D(SCB 10X 研发部) ; SCB 10X ; SCBX Group(SCBX 团体) ; Faculty of Medicine Siriraj Hospital(素里雅医院医学学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文研究了医学推理模型在不同答案格式下的鲁棒性,发现监督微调更稳定,而强化微调易出现跨格式脆性,需谨慎评估以应用于实际医疗场景。
Comments 62 pages, 47 figures
nvBench 2.0:通过分步推理解决文本到可视化中的歧义
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 nvBench 2.0通过分步推理解决文本到可视化中的歧义问题,提出Step-Text2Vis模型在模糊场景中表现更优。
基于回忆的推理:评估基于RAG的心理健康对话系统中通用架构与专门微调的有效性
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文通过比较通用推理模型与领域特定微调模型,发现通用模型在同理心和上下文理解方面表现更优,表明强大的推理能力比专门训练更能提升心理健康对话系统的效果。
韩国规范法律基准:迈向独立于领域知识的LLM法律推理能力评估
机构 * University of Seoul(首尔大学) ; LBOX
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 韩国规范法律基准通过问题级支持先例评估LLM法律推理能力,揭示领域知识依赖下的模型差距,展示推理专用模型的优越性。
Comments EACL 2026
RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进
机构 * School of Software, Beihang University(北京航空航天大学软件学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。
Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/
通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理
机构 * Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。
Comments accepted by VLDB' 25
FormulaReasoning:一个用于基于公式的数值推理的数据集
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 FormulaReasoning数据集通过引入基于物理原理的数值推理任务,提供细粒度注释和扩展版本,评估多种推理框架,揭示公式推理中的关键挑战与未来研究方向。
Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架
机构 * Sourena Khanzadeh(独立研究者)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。
AI代理系统:架构、应用与评估
机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI
AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。
从失败到精通:为工具使用代理生成困难样本
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本文提出HardGen方法,通过生成具有可验证推理的困难样本,提升工具使用代理的训练效果。
DVGBench: 面向无人机影像的隐式到显式视觉 grounding 评估基准
机构 * Hinton STAI Institute(Hinton STAI研究所) ; Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部)) ; School of Geospatial Artificial Intelligence, East China Normal University(地理空间人工智能学院) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Information Engineering University(信息工程大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 DVGBench 是一个面向无人机影像的隐式到显式视觉 grounding 评估基准,通过设计 DroneVG-R1 模型提升 LVLM 的推理能力。
Comments 20 pages, 17 figures
多智能体协作奖励设计以增强强化学习中的推理
机构 * Gradient ; Waseda University(早稻田大学) ; Columbia University(哥伦比亚大学) ; Hong Kong Polytechnic University(香港理工大学) ; Rice University(莱斯大学)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 多智能体协作奖励模型通过分解偏好评估和引入集中化聚合器,提升强化学习中的鲁棒性和可解释性,同时提供透明的奖励建模方法。
UNIDOC-BENCH: 一个统一的文档中心多模态RAG基准
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 UniDoc-Bench是首个大规模文档中心多模态RAG基准,通过多模态问答对评估文本-图像融合与联合检索性能,揭示多模态嵌入不足及视觉上下文补充机制。
基于人类与大语言模型协作的上下文自适应需求缺陷预测
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出基于人类与大语言模型协作的上下文自适应需求缺陷预测方法,通过反馈循环和少量样本学习提升预测性能,优于传统方法。
Comments Accepted at ICSE-NIER 2026
幻觉与事实:大型语言模型中事实核查与事实性评估的综述
机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) ; Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) ; Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。
Journal ref Artif. Intell. Rev. (2026)
大型语言模型的知识蒸馏与数据集蒸馏:新兴趋势、挑战与未来方向
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文综述了大型语言模型的知识蒸馏与数据集蒸馏技术,探讨了其在压缩模型、保持推理能力及语言多样性方面的挑战与未来发展方向。
GRAPHMOE: 通过引入自我反思机制提升混合专家网络的认知深度
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) ; The University of Manchester(曼彻斯特大学) ; The University of Pittsburgh(匹兹堡大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; University of Sydney(悉尼大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 GRAPHMOE通过引入自我反思机制,提升混合专家网络的认知深度,实现语言模型的先进性能。
Comments 10 pages
ScienceDB AI: 基于大语言模型的代理推荐系统用于大规模科学数据共享服务
机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing, China(中国科学院计算机网络信息中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 ScienceDB AI 是首个基于大语言模型的对话推荐系统,专为大规模科学数据共享服务设计,通过自然语言对话和深度推理实现精准的数据集推荐。
Comments 12 pages, 9 figures
MedKGI: 基于医学知识图谱和信息引导提问的迭代诊断
机构 * Sichuan University(四川大学) ; HKUST(香港科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 MedKGI通过整合医学知识图谱和信息引导提问,提升临床诊断的准确性和效率。