arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-12 至 2026-02-12 共收录 86 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 19 篇

2602.10127 2026-02-12 cs.SI cs.AI cs.CR 57%

"Humans welcome to observe": A First Look at the Agent Social Network Moltbook

人类欢迎观察:Agent社会网络Moltbook的首次观察

Yukun Jiang, Yage Zhang, Xinyue Shen, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了首个专为AI代理设计的社会网络Moltbook,分析其主题讨论、风险分布及毒性演变,揭示了代理社交网络中信息传播的复杂性及平台稳定性挑战。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10122 2026-02-12 cs.CY cs.AI 57%

A Practical Guide to Agentic AI Transition in Organizations

组织中代理AI转型的实用指南

Eranga Bandara, Ross Gore, Sachin Shetty, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Ravi Mukkamala, Peter Foytik, Safdar H. Bouk, Abdul Rahman, Xueping Liang, Amin Hass, Tharaka Hewa, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(旧 Dominion 大学) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学) Center for Wireless Communications, University of Oulu(无线通信中心,奥卢大学) University of Sri Jayewardenepura(斯里贾yenepura大学) Accenture Technology Labs(埃森哲技术实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种实用框架,帮助组织将手动流程转型为自动化代理AI系统,通过领域驱动用例识别、任务委托给AI代理及人机协同模型实现可持续的自动化与业务价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 3 篇

2602.11024 2026-02-12 cs.CV cs.AI 79%

Chain-of-Look Spatial Reasoning for Dense Surgical Instrument Counting

密集手术器械计数的链式观察空间推理

Rishikesh Bhyri, Brian R Quaranto, Philip J Seger, Kaity Tung, Brendan Fox, Gene Yang, Steven D. Schwaitzberg, Junsong Yuan, Nan Xi, Peter C W Kim

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Chain-of-Look框架,通过结构化视觉链提升密集手术器械计数的准确性,并引入邻近损失函数和SurgCount-HD数据集,实验证明其在复杂场景中的优越性能。

Comments Accepted to WACV 2026. This version includes additional authors who contributed during the rebuttal phase

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13444 2026-02-12 cs.CL cs.CV 79%

ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models

ChartMuseum: 测试大型视觉-语言模型的视觉推理能力

Liyan Tang, Grace Kim, Xinyu Zhao, Thom Lake, Wenxuan Ding, Fangcong Yin, Prasann Singhal, Manya Wadhwa, Zeyu Leo Liu, Zayne Sprague, Ramya Namuduri, Bodun Hu, Juan Diego Rodriguez, Puyuan Peng, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ChartMuseum通过评估复杂视觉和文本推理能力,揭示了大型视觉-语言模型在视觉推理上的不足。

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15933 2026-02-12 cs.CV 67%

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

城市真实环境中的导航:探索从大规模知识中涌现的导航

Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出稀疏关联视觉导航任务,通过CityNav基准评估MLLMs在真实城市环境中的导航能力,并提出VoP方法提升导航性能。

Comments Accepted at EACL 2026 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2602.10885 2026-02-12 cs.AI cs.LG 90%

Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics

通过自演化评分标准强化链式推理

Leheng Sheng, Wenchang Ma, Ruixin Hong, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 RLCER通过自演化评分标准提升链式推理的奖励机制,无需人工标注即可实现更高效的推理性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09555 2026-02-12 cs.CL 70%

Advancing Block Diffusion Language Models for Test-Time Scaling

推进块扩散语言模型用于测试时间扩展

Yi Lu, Deyang Kong, Jianing Wang, Linsen Guo, Xue Wang, Qi Guo, Tao Gui, Xuanjing Huang, Wei Ye, Shikun Zhang, Wei Wang

机构 * Fudan University(复旦大学) Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出BACD和TCCF方法,提升块扩散语言模型在测试时间扩展中的推理效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10329 2026-02-12 cs.CL cs.AI cs.LG 67%

Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality

更多令牌是否理性?语言模型推理时的扩展作为适应性资源理性

Zhimin Hu, Riya Roshan, Sashank Varma

机构 * Georgia Tech(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过变量归因任务探讨语言模型在推理时扩展对资源理性的影响,发现模型能根据任务复杂性调整策略,即使无显式成本奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05188 2026-02-12 cs.CL cs.AI 62%

Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling

修复破碎的指南针:诊断并改进推理时间奖励建模

Jiachun Li, Pengfei Cao, Zhuoran Jin, Yubo Chen, Jiexin Xu, Huaijun Li, Xiaojian Jiang, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) China Merchants Bank(中国 Merchants 银行)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRISP算法,通过聚类和逐步前缀优化,提升LLM在推理任务中的性能,实现5%的准确率提升。

Comments 38 pages, 30 figures, Accpeted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10522 2026-02-12 cs.SE 50%

Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions

一致性与验证:在没有真实解决方案的情况下提升大型语言模型的测试生成质量

Hamed Taherkhani, Alireza DaghighFarsoodeh, Mohammad Chowdhury, Hung Viet Pham, Hadi Hemmati

专题命中 测试时计算 :reasoning(abstract)

AI总结 ConVerTest通过自我一致性、验证链和双执行协议,在无需真实解决方案的情况下提升大型语言模型的测试生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 8 篇

2505.11924 2026-02-12 cs.CL cs.AI cs.LG 82%

Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

Journal ref 4th Deployable AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10148 2026-02-12 cs.CR cs.AI 79%

Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks

多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型

Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CrossTALK方法,通过跨模态纠缠攻击提升对视觉-语言模型的劫持效果,实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11114 2026-02-12 cs.MA cs.AI cs.LG cs.SE 62%

Learning to Compose for Cross-domain Agentic Workflow Generation

跨领域代理工作流生成中的学习组合

Jialiang Wang, Shengxiang Xu, Hanmo Liu, Jiachuan Wang, Yuyu Luo, Shimin Di, Min-Ling Zhang, Lei Chen

机构 * Hong Kong University of Science and Technology(香港理工大学) Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Southeast University(东南大学) University of Tsukuba(茨口大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于分解-重组-决策机制的跨领域代理工作流生成方法,通过学习可重用能力实现单次生成,提升效率并减少迭代成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10458 2026-02-12 cs.AI cs.LG 62%

Found-RL: foundation model-enhanced reinforcement learning for autonomous driving

Found-RL: 基于基础模型的强化学习用于自动驾驶

Yansong Qu, Zihao Sheng, Zilin Huang, Jiancong Chen, Yuhao Luo, Tianyi Wang, Yiheng Feng, Samuel Labi, Sikai Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Found-RL通过异步批量推理和多样化监督机制,提升自动驾驶中强化学习的效率与实时性。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25112 2026-02-12 cs.AI cs.MA 57%

AI Driven Discovery of Bio Ecological Mediation in Cascading Heatwave Risks

由人工智能驱动的生物生态中介在连锁热浪风险中的发现

Yiquan Wang, Tin-Yeh Huang, Qingyun Gao, Yuhan Chang, Jialin Zhang

机构 * College of Mathematics and System Science, Xinjiang University, Urumqi, Xinjiang, China(数学与系统科学学院,新疆大学) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(地理科学与自然资源研究所,中国科学院) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University, Hong Kong, China(工业与系统工程系,香港理工大学) Xinya College, Tsinghua University, Beijing, China(清华学院) College of Architectural Engineering, Xinjiang University, Urumqi, Xinjiang, China(建筑工程学院,新疆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出HeDA框架,通过构建知识图谱发现生物生态中介效应,揭示热浪风险的复杂系统性影响,并推动适应策略向动态跨系统韧性转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15922 2026-02-12 cs.CL 57%

Aligning Dialogue Agents with Global Feedback via Large Language Model Multimodal Reward Decomposition

通过大语言模型多模态奖励分解对齐对话代理

Dong Won Lee, Hae Won Park, Cynthia Breazeal, Louis-Philippe Morency

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于大语言模型的多模态奖励分解方法,通过分解会话级反馈来提升对话生成质量,无需人工反馈。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10146 2026-02-12 cs.CV cs.CL 57%

VERA: Identifying and Leveraging Visual Evidence Retrieval Heads in Long-Context Understanding

VERA:识别和利用长上下文理解中的视觉证据检索头

Rongcan Pei, Huan Li, Fang Guo, Qi Zhu

机构 * Tongji University(同济大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Amazon Web Services(亚马逊网络服务)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 VERA通过识别和利用视觉证据检索头,提升长上下文理解能力,显著提高开源VLMs的性能。

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11409 2026-02-12 cs.CR cs.AI 57%

LLMs as Hackers: Autonomous Linux Privilege Escalation Attacks

大语言模型作为黑客:自主Linux提权攻击

Andreas Happe, Aaron Kaplan, Juergen Cito

机构 * TU Wien(维也纳技术大学) Deep-Insight AI(深洞察AI)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出hackingBuddyGPT,通过LLM实现自主Linux提权攻击,评估不同模型在提权任务中的性能,发现GPT-4-Turbo表现优异,接近人类渗透测试员水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 22 篇

2503.16858 2026-02-12 cs.CL cs.AI 81%

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

MTBench: 一种多模态时间序列基准,用于时间推理和问答

Jialin Chen, Aosong Feng, Ziyu Zhao, Juan Garza, Gaukhar Nurbek, Cheng Qin, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

机构 * Yale University, New Haven, CT, USA(耶鲁大学) McGill University, Montreal, QC, Canada(麦吉尔大学) University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MTBench是一种多模态时间序列基准,用于评估大型语言模型在金融和天气领域的时间推理和问答能力。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16814 2026-02-12 cs.LG cs.CL 81%

From Belief Entrenchment to Robust Reasoning in LLM Agents

从信念固化到LLM代理的稳健推理

Jihwan Oh, Minchan Jeong, Jongwoo Ko, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 DReaMAD通过引入多样化推理和动态辩论机制,有效缓解了LLM代理中的信念固化问题,提升了推理准确性与胜率。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14986 2026-02-12 cs.AI cs.CL 81%

Implicit Probabilistic Reasoning Does Not Reflect Explicit Answers in Large Language Models

隐式概率推理不反映大语言模型中的显式答案

Manuel Mondal, Ljiljana Dolamic, Gérôme Bovet, Philippe Cudré-Mauroux, Julien Audiffren

机构 * University of Fribourg, Switzerland(弗里堡大学) armasuisse S+T, Switzerland(armasuisse S+T)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大语言模型在显式概率推理中表现良好,但在隐式概率推理中预测与真实情况存在显著差异,且传统评估方法无法检测此类错误。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10787 2026-02-12 cs.SE cs.AI cs.CR cs.IR 79%

VulReaD: Knowledge-Graph-guided Software Vulnerability Reasoning and Detection

VulReaD: 基于知识图谱的软件漏洞推理与检测

Samal Mukhtar, Yinghua Yao, Zhu Sun, Mustafa Mustafa, Yew Soon Ong, Youcheng Sun

机构 * The University of Manchester(曼彻斯特大学) Agency for Science, Technology and Research(科技研究局) Singapore University of Technology and Design(新加坡科技设计大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VulReaD通过知识图谱引导的推理方法,在软件漏洞检测中实现CWE级别的分类,提升二元和多类检测性能,增强可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10575 2026-02-12 cs.CV cs.AI cs.CY 79%

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

MetaphorStar: 基于端到端视觉强化学习的图像隐喻理解与推理

Chenhao Zhang, Yazhe Niu, Hongsheng Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MetaphorStar通过端到端视觉强化学习框架提升图像隐喻理解与推理能力,显著优于现有模型。

Comments 14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10210 2026-02-12 cs.LG 79%

How Much Reasoning Do Retrieval-Augmented Models Add beyond LLMs? A Benchmarking Framework for Multi-Hop Inference over Hybrid Knowledge

检索增强模型在大语言模型之上添加多少推理能力?一种用于混合知识多跳推理的基准评估框架

Junhong Lin, Bing Zhang, Song Wang, Ziyan Liu, Dan Gutfreund, Julian Shun, Yada Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) University of Central Florida(中央佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 HybridRAG-Bench通过混合知识和多跳推理评估框架,有效区分真实检索与参数回忆,为混合知识增强推理系统提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-02-12 cs.CV cs.AI 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17667 2026-02-12 cs.AI 79%

PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level

PhysUniBench: 一个面向本科生层面的多模态物理推理基准测试

Lintao Wang, Encheng Su, Jiaqi Liu, Pengze Li, Jiabei Xiao, Wenlong Zhang, Xinnan Dai, Xi Chen, Yuan Meng, Lei Bai, Wanli Ouyang, Shixiang Tang, Aoran Wang, Xinzhu Ma

机构 * The University of Sydney(悉尼大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Michigan State University(密歇根州立大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PhysUniBench是一个面向本科生层面的多模态物理推理基准测试,旨在评估和提升多模态大语言模型在物理问题上的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10656 2026-02-12 eess.AS cs.SD 78%

AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval

AudioRAG:一个用于音频推理和信息检索的挑战性基准

Jingru Lin, Chen Zhang, Tianrui Wang, Haizhou Li

专题命中 推理评测 :reasoning(title,abstract)

AI总结 AudioRAG是一个用于评估音频推理和信息检索能力的挑战性基准,通过整合检索增强生成技术,为未来研究提供更强大的基准。

Comments Accepted by Audio-AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 77%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10814 2026-02-12 cs.AI 70%

See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch

见、计划、快照:评估Scratch中的多模态GUI代理

Xingyi Zhang, Yulei Ye, Kaifeng Huang, Wenhao Li, Xiangfeng Wang

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出ScratchWorld基准,用于评估多模态GUI代理在Scratch中的程序构建能力,揭示了推理与执行之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10886 2026-02-12 cs.CL cs.AI cs.CE 62%

The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems

CLEF-2026金融多语言多模态评估实验室:金融AI系统的多语言多模态评估框架

Zhuohan Xie, Rania Elbadry, Fan Zhang, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Dimitar Dimitrov, Vanshikaa Jani, Yuyang Dai, Jiahui Geng, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Preslav Nakov

机构 * MBZUAI The University of Tokyo(东京大学) The Fin AI(Fin AI) University of Arizona(亚利桑那大学) INSAIT

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CLEF-2026金融多语言多模态评估实验室提出首个多语言多模态金融AI评估框架,涵盖金融理解、推理和决策三个任务,旨在推动全球包容的金融AI发展。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏