Evaluation and Benchmarking Suite for Financial Large Language Models and Agents
金融大语言模型与代理的评估与基准测试套件
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一套评估和基准测试套件,用于评估和比较金融大语言模型与代理,促进更稳健的FinAI生态系统。
Comments 13 pages, 13 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
金融大语言模型与代理的评估与基准测试套件
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一套评估和基准测试套件,用于评估和比较金融大语言模型与代理,促进更稳健的FinAI生态系统。
Comments 13 pages, 13 figures
守护历史真实:检测大语言模型中的历史修正主义
专题命中 推理评测 :self-correction(abstract)
AI总结 该研究提出HistoricalMisinfo数据集,用于评估大语言模型在面对历史修正主义请求时的鲁棒性及事实准确性。
Comments Accepted at IASEAI 2026, non-archival
一个用于高级多模态个性化研究的基准和知识引导框架
机构 * Google(谷歌) ; DeepMind(深Mind)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。
缩小大型语言模型评估中的复杂性差距
专题命中 推理评测 :reasoning(abstract)
AI总结 GeneBench通过增加编程基准的复杂性,揭示了LLMs在真实世界任务中的表现下降,证明了其评估的挑战性。
LAPIS:轻量级智能系统API规范
专题命中 推理评测 :reasoning(abstract)
AI总结 LAPIS是一种为LLM优化的轻量级API规范格式,通过减少token使用并保留语义信息,提升智能系统对API的处理效率。
通过其计算图验证推理链
机构 * FAIR at Meta(Meta 的 FAIR 部门) ; Meta Superintelligence Labs(Meta 超智能实验室) ; University of Edinburgh(爱丁堡大学)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过分析计算图结构特征,提出基于电路的推理验证方法,揭示推理错误的结构指纹并有效纠正模型错误推理。
Comments Accepted to ICLR 2026 (Oral)
MolReasoner:迈向分子大语言模型的有效且可解释的推理
机构 * DP Technology, Beijing, China(DP技术有限公司) ; AI for Science Institute, Beijing, China(AI for Science研究院) ; Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; Fudan University, Shanghai, China(复旦大学)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MolReasoner通过两阶段框架提升分子大语言模型的推理能力和可解释性,有效减少幻觉并提高生成质量。
联邦推理蒸馏框架与模型可学习性感知的数据分配
机构 * Beihang University(北航) ; Heilongjiang University(黑龙江大学) ; Beijing University of Civil Engineering and Architecture(北京建筑大学) ; Yanshan University(燕山大学) ; Shandong University(山东大学) ; Renmin University of China(中国人民大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 LaDa是一种联邦推理蒸馏框架,通过模型可学习性感知的数据分配和领域自适应推理蒸馏方法,解决双向模型可学习性差距和领域无关推理迁移问题。
这个句子来自哪里?在LLM推理蒸馏中的溯源
机构 * College of Computer Science and Technology(计算机科学与技术学院) ; Alibaba Cloud Computing(阿里云计算) ; School of Artificial Intelligence(人工智能学院) ; Department of Mathematics(数学系)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出了一种推理蒸馏溯源追踪框架,通过分析蒸馏模型生成动作的来源,揭示其在测试时的行为一致性,并提出教师指导的数据选择方法以提升蒸馏效果。
多样化激励探索用于多面推理
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Westlake University(西湖大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 DIVER通过引入全局多样性激励,提升大语言模型在多面推理任务中的探索能力和样本效率。
Comments 26 pages, 10 figures
Journal ref ICLR 2026
清晰可见,自信推理:用于视觉语言模型盲点的即插即用修复方法
机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) ; Department of Computer Science, University of Memphis(密苏里大学计算机科学系)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出一种无需微调的即插即用模块,通过细化视觉标记和丰富文本提示,提升VLM对罕见物体的推理能力。
Comments Accepted by CVPR 2026
EBPO:经验贝叶斯收缩用于稳定群体相对策略优化
机构 * Meta AI
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 EBPO通过经验贝叶斯收缩方法稳定群体相对策略优化,有效降低估计方差并提升训练稳定性。
弥合语言模型中文本与语音理解之间的差距
机构 * Université de Toulon, Aix Marseille Université, CNRS, LIS(法国图卢兹大学、马赛大学、CNRS、LIS)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SALAD通过主动选择和跨模态蒸馏提高语音与文本对齐,以更高效的方式弥合LLMs在语音理解上的性能差距。
关于大型语言模型强化学习动态的可预测性
机构 * USTC(中国科学技术大学) ; NUS(新加坡国立大学) ; HKUST(香港科技大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究发现大型语言模型强化学习动态的两个基本特性,并提出AlphaRL框架实现加速训练,保留高推理性能。
Comments 48 pages, 28 figures;
Shop-R1: 通过强化学习奖励大语言模型模拟在线购物中的人类行为
机构 * Michigan State University(密歇根州立大学) ; Amazon(亚马逊) ; Northeastern University(东北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Northwestern University(西北大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 Shop-R1通过强化学习框架提升大语言模型在在线购物场景中模拟人类行为的推理能力,实现65%以上的性能提升。
Comments Accepted by ICLR 2026. The project page is available at https://damon-demon.github.io/shop-r1.html
Vid2Sid: 视频可以帮助缩小仿真到现实的差距
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 Vid2Sid通过视频驱动的系统识别方法,结合基础模型感知与VLM循环优化器,实现仿真到现实的物理参数校准,提供可解释的推理并提升校准精度。
TAG:基于动作单元的面部表情识别中的思维
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。
Comments 33 pages, 8 figures
从像素到词语 -- 向大规模原生视觉-语言原始语义迈进
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; SenseTime Research(商汤科技研究院) ; Xi’an Jiaotong University(西安交通大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。
Comments 21 pages, 8 figures, Accepted by ICLR2026
测试时训练可证明地提高变换器作为上下文学习者
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 测试时训练通过调整模型权重提升变换器在上下文学习中的性能,减少样本需求并提高推理效率。
Comments Accepted at ICML 2025
Pixel2Phys: 从视觉动态中提炼 governing laws
专题命中 其他推理 :reasoning(abstract)
AI总结 Pixel2Phys通过协作多智能体框架从视觉动态中自动提炼物理定律,实现从高维数据到简洁可解释方程的转化。
Comments CVPR2026 main track
解耦视觉与语言:基于代码本的视觉适应
机构 * AWS ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 其他推理 :reasoning(abstract)
AI总结 CRAFT通过离散代码本解耦视觉与语言,实现无需修改其他部分的领域适应,提升LVLMs性能。
Comments 17 pages, accepted to CVPR2026 main conference
对话式AI助教的路径:整合辅导最佳实践和定向技术以产生可扩展的AI代理
专题命中 其他推理 :reasoning(abstract)
AI总结 本文探讨了通过整合辅导最佳实践和生成式AI技术,开发可扩展且有效的对话式AI助教的研究路径。
PositionOCR: 通过混合专家整合增强多模态模型的位置意识
专题命中 其他推理 :reasoning(abstract)
AI总结 PositionOCR通过整合文本定位专家与LLM的上下文能力,提升多模态模型在文本定位和定位任务中的位置准确性。