arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-03 至 2026-03-03 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 61 篇

2510.04040 2026-03-03 cs.AI 89%

FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning

FaithCoT-Bench: 对链式推理实例级忠实度的基准测试

Xu Shen, Song Wang, Zhen Tan, Laura Yao, Xinyu Zhao, Kaidi Xu, Xin Wang, Tianlong Chen

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 FaithCoT-Bench提出了一种统一的基准,用于评估链式推理在实例级的忠实度,通过专家标注的轨迹和系统评估揭示了现有方法的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01783 2026-03-03 cs.CV 89%

Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing

在多模态大语言模型中利用链式推理进行人脸反伪装

Honglu Zhang, Zhiqin Fang, Ningning Zhao, Saihui Hou, Long Ma, Renwang Pei, Zhaofeng He

机构 * Didi Chuxing(滴滴出行) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Normal University(北京师范大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

AI总结 本文提出FaceCoT数据集和CEPL策略,通过链式推理提升多模态大语言模型在人脸反伪装中的鲁棒性和性能。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06749 2026-03-03 cs.CV cs.AI cs.CL cs.LG 87%

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Vision-R1: 促进多模态大语言模型推理能力的激励方法

Wenxuan Huang, Bohan Jia, Zijie Zhai, Shaosheng Cao, Zheyu Ye, Fei Zhao, Zhe Xu, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Vision-R1通过构建高质量多模态CoT数据集和渐进性思维抑制训练策略,提升多模态推理能力,在数学推理基准中取得显著成绩。

Comments Accepted to ICLR 2026. Code is available at https://github.com/Osilly/Vision-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00889 2026-03-03 cs.CL cs.AI 86%

CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning

CHIMERA:紧凑的合成数据用于通用的LLM推理

Xinyu Zhu, Yihao Feng, Yanchao Sun, Xianzhi Du, Pingzhi Li, Olli Saarikivi, Yun Zhu, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Apple(苹果公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 CHIMERA通过紧凑的合成数据集提升LLM跨领域推理能力,提供丰富推理轨迹和结构化覆盖,实现高效训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24119 2026-03-03 cs.AI cs.CL cs.LG 85%

SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning

SPIRAL:通过多智能体多轮强化学习进行零和游戏的自我对战以促进推理

Bo Liu, Leon Guertler, Simon Yu, Zichen Liu, Penghui Qi, Daniel Balcells, Mickel Liu, Cheston Tan, Weiyan Shi, Min Lin, Wee Sun Lee, Natasha Jaques

机构 * National University of Singapore(新加坡国立大学) Northeastern University(东北大学) Sea AI Lab(Sea AI 实验室) Centre for Frontier AI Research (CFAR), A*STAR(前沿人工智能研究中心(CFAR),A*STAR) Plastic Labs University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIRAL通过多智能体多轮强化学习在零和游戏中促进推理,展示了模型在多个基准测试中的显著性能提升。

Comments Accepted at ICLR 2026. Code: https://github.com/spiral-rl/spiral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01353 2026-03-03 cs.LG cs.AI cs.CL 85%

Constructing Synthetic Instruction Datasets for Improving Reasoning in Domain-Specific LLMs: A Case Study in the Japanese Financial Domain

构建合成指令数据集以提升领域特定大语言模型的推理能力:以日本金融领域为例

Yuma Okochi, Fabio Milentiansen Sim, Tomoyasu Okada

机构 * Nomura Research Institute, Ltd.(摩根士丹利研究机构)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种通用方法,通过构建合成指令数据集提升领域特定大语言模型的推理能力,并在金融领域进行了验证。

Comments 8 pages, 2 figures. Japanese version published in NLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03135 2026-03-03 cs.CV cs.AI cs.CL 84%

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

OmniSpatial:迈向视觉语言模型的空间推理综合基准

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Xian Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Galbot Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 OmniSpatial是一个基于认知心理学的综合性空间推理基准,通过动态推理、复杂空间逻辑等四个类别,评估视觉语言模型在空间推理上的能力与局限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02119 2026-03-03 cs.AI cs.GT cs.LG 81%

Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning

笔算谜题基准:多步骤可验证推理的基准

Justin Waugh

机构 * Approximate Labs

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Pencil Puzzle Bench通过笔算谜题评估大语言模型的多步骤可验证推理能力,揭示推理努力和代理迭代能力的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02024 2026-03-03 cs.CL cs.AI cs.CV 81%

MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning

MMR-Life: 组合真实场景以进行多模态多图像推理

Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MMR-Life是一个评估多模态多图像推理能力的综合基准,通过现实场景中的多图像信息整合和多种推理类型测试,揭示了现有模型在复杂推理任务中的挑战和性能差异。

Comments Accepted by ICLR 2026, 78 pages, 60 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08616 2026-03-03 q-fin.ST cs.AI cs.LG q-fin.CP 81%

Reasoning on Time-Series for Financial Technical Analysis

用于金融技术分析的时间序列推理

Kelvin J. L. Koa, Jan Chen, Yunshan Ma, Huanhuan Zheng, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Technical University of Munich(慕尼黑技术大学) Singapore Management University(新加坡管理学院) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 VTA通过结合语言和潜在推理,生成准确且可解释的股票时间序列预测,展示了在金融技术分析中的优越性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02386 2026-03-03 cs.CR cs.AI cs.LG 81%

On The Fragility of Benchmark Contamination Detection in Reasoning Models

在推理模型中基准污染检测的脆弱性

Han Wang, Haoyu Li, Brian Ko, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LRMs在基准污染检测中存在脆弱性,通过简单方法可轻易污染模型以提升排行榜表现,威胁评估公平性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02010 2026-03-03 cs.LG cs.AI 81%

When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models

当推理遇见压缩:理解LLMs压缩对大推理模型的影响

Nan Zhang, Eugene Kwek, Yusen Zhang, Ngoc-Hieu Nguyen, Prasenjit Mitra, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了压缩对大推理模型的影响,通过基准测试和机制解释,发现权重数量对知识记忆的影响大于推理,并揭示了蒸馏模型中关键组件的重要性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19791 2026-03-03 cs.CL cs.IR 79%

ToolDreamer: Instilling LLM Reasoning Into Tool Retrievers

ToolDreamer: 将大语言模型推理能力注入工具检索器

Saptarshi Sengupta, Zhengyu Zhou, Jun Araki, Xingbo Wang, Bingqing Wang, Suhang Wang, Zhe Feng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Bosch Research North America(博世北美研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ToolDreamer通过合成工具描述来改进工具检索,提升稀疏和密集检索器性能,减少LLM上下文窗口压力。

Comments Accepted to EACL 2026 (main/oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01580 2026-03-03 cs.CL 79%

Markovian ODE-guided scoring can assess the quality of offline reasoning traces in language models

马尔可夫ODE引导的评分可以评估语言模型离线推理轨迹的质量

Arghodeep Nandi, Ojasva Saxena, Tanmoy Chakraborty

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(电子工程系,印度理工学院德里) Indian Institute of Technology Delhi(印度理工学院德里) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(人工智能学院,印度理工学院德里)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MarODE通过马尔可夫模型和常微分方程评估语言模型推理轨迹质量,有效提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01106 2026-03-03 cs.AI 79%

DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage

DIVA-GRPO:通过难度自适应变体优势增强多模态推理

Haowen Gao, Zhenyu Zhang, Liang Pang, Fangda Guo, Hongjian Dou, Guannan Lv, Shaoguo Liu, Tingting Gao, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Kuaishou Technology, Beijing, China(快手科技,北京,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DIVA-GRPO通过难度自适应变体优势方法提升多模态推理能力,解决GRPO在困难问题上的奖励稀疏性和优势消失问题,提升训练稳定性与推理性能。

Comments Accepted to ICLR 2026. Code and models are available at https://github.com/Siaaaaaa1/DIVA-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03906 2026-03-03 cs.AI 79%

Toward Clinically Explainable AI for Medical Diagnosis: A Foundation Model with Human-Compatible Reasoning via Reinforcement Learning

迈向临床可解释的AI:通过强化学习实现人友好的推理基础模型

Qika Lin, Yifan Zhu, Bin Pu, Ling Huang, Haoran Luo, Jingying Ma, Feng Wu, Kai He, Jiaxing Xu, Zhen Peng, Tianzhe Zhao, Fangzhi Xu, Jian Zhang, Zhonghong Ou, Erik Cambria, Swapnil Mishra, Mengling Feng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DeepMedix-R1通过强化学习实现临床可解释的AI,生成透明推理过程,优于现有模型,提升医学诊断的可解释性和实用性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02404 2026-03-03 cs.CL 79%

AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs

AnesSuite: 一个用于LLM麻醉推理的全面基准和数据集套件

Xiang Feng, Wentao Jiang, Zengmao Wang, Yong Luo, Pingbo Xu, Baosheng Yu, Hua Jin, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心和多媒体与网络通信工程湖北省重点实验室、武汉大学) Department of Anesthesiology, Zhejiang Cancer Hospital, China(麻醉科、浙江省癌症医院) Institute of Medicine, Chinese Academy of Sciences, Hangzhou, Zhejiang, China(医学研究所、中国科学院、杭州、浙江) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光耀医学院、南洋理工大学、新加坡) Centre of AI in Medicine, Nanyang Technological University, Singapore(医学人工智能中心、南洋理工大学、新加坡) Department of Anesthesiology, First People’s Hospital of Yunnan Province, China(麻醉科、云南第一人民医院) Kunming University of Science and Technology, China(昆明理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AnesSuite为LLM麻醉推理提供首个全面基准和数据集,开发Morpheus模型在麻醉领域实现显著性能提升。

Comments Accepted in ICLR 2026; 47 pages, 12 figures, 26 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00686 2026-03-03 cs.CL 79%

RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis

RAVEL: 用于验证和评估大语言模型文本合成的推理代理

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Bosi Wen, Yidong Wang, Lin Fan, Yilin Zhou, Zikang Wang, Wenbo Yu, Lindong Wu, Hongning Wang, Minlie Huang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 RAVEL通过引入智能体框架和C3EBench基准,评估LLM在文本合成中的推理能力,发现推理能力比生成能力更重要。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15332 2026-03-03 cs.LG 79%

Directional Reasoning Trajectory Change (DRTC): Identifying Critical Trace Segments in Reasoning Models

方向性推理轨迹变化(DRTC):在推理模型中识别关键轨迹段

Waldemar Chang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 DRTC通过过程因果方法识别推理模型中的关键轨迹段,揭示特定上下文元素如何引导推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00206 2026-03-03 cs.CV cs.AI 79%

TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models

TACIT基准:一个生成和判别模型的程序化视觉推理基准

Daniel Nobrega Medeiros

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TACIT基准提出一个程序化视觉推理测试,包含10个任务和6个领域,通过生成和判别双轨评估模型在空间导航、抽象模式完成等任务中的推理能力。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06499 2026-03-03 cs.CV 78%

SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports

SportR:多模态大语言模型在体育中的推理基准

Haotian Xia, Haonan Ge, Junbo Zou, Hyun Woo Choi, Xuebin Zhang, Danny Suradja, Botao Rui, Ethan Tran, Wendy Jin, Zhen Ye, Xiyang Lin, Christopher Lai, Shengjie Zhang, Junwen Miao, Shichao Chen, Rhys Tracy, Vicente Ordonez, Weining Shen, Hanjie Chen

机构 * Department of Computer Science, Rice University(Rice大学计算机科学系) Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) Department of Statistics, University of California, Irvine(伊利诺伊大学欧文分校统计系) College of Sciences, Georgia Institute of Technology(佐治亚理工学院科学学院) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 SportR是一个多体育大规模基准,旨在训练和评估多模态大语言模型在体育推理中的能力,通过精细的视觉感知和规则推理任务提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04201 2026-03-03 cs.CV 78%

SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios

SToLa:具有触觉常识推理的自适应触觉-语言框架在开放性场景中

Ning Cheng, Jinan Xu, Jialing Chen, Bin Fang, Wenjuan Han

专题命中 推理评测 :reasoning(title,abstract)

AI总结 SToLa通过专家混合架构实现触觉与语言模态的自适应统一,解决开放性场景中触觉常识推理的挑战,提升多模态推理性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00971 2026-03-03 cs.CV 78%

Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning

揭示认知罗盘:基于理论of-Mind的多模态情感推理

Meng Luo, Bobo Li, Shanqing Xu, Shize Zhang, Qiuchan Chen, Menglu Han, Wenhao Chen, Yanxiang Huang, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出HitEmotion基准和TMPO方法,通过理论of-Mind引导多模态情感推理,提升模型情感理解和认知能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07484 2026-03-03 cs.IR 78%

Reasoning by Exploration: A Unified Approach to Retrieval and Generation over Graphs

通过探索进行推理:一种统一的图检索与生成方法

Haoyu Han, Kai Guo, Harry Shomer, Yu Wang, Yucheng Chu, Hang Li, Li Ma, Jiliang Tang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 RoE通过统一检索与生成过程,利用图探索机制提升大型语言模型在结构化图推理中的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22339 2026-03-03 cs.CV 78%

CircuitSense: A Hierarchical MLLM Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process

CircuitSense: 一种层次化的MLLM基准,连接视觉理解和符号推理在工程设计过程

Arman Akbari, Jian Gao, Yifei Zou, Mei Yang, Jinru Duan, Dmitrii Torbunov, Yanzhi Wang, Yihui Ren, Xuan Zhang

机构 * Northeastern University(东北大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CircuitSense提出一个层次化基准,评估工程设计中视觉理解与符号推理的能力,揭示闭源模型在符号推导上的不足,强调数学理解对电路综合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02202 2026-03-03 cs.LG 77%

Frontier Models Can Take Actions at Low Probabilities

前沿模型能够以低概率采取行动

Alex Serrano, Wen Xing, David Lindner, Erik Jenner

机构 * MATS Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 前沿模型在低概率下执行目标行动时表现良好,但缺乏熵源时难以保持校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09285 2026-03-03 cs.CV 75%

Spotlight on Token Perception for Multimodal Reinforcement Learning

多模态强化学习中的token感知聚焦

Siyuan Huang, Xiaoye Qu, Yafu Li, Yun Luo, Zefeng He, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Wuhan University(武汉大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。

Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00530 2026-03-03 cs.AI cs.CL 73%

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

CityLens:评估大型视觉-语言模型用于城市社会经济感知

Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CityLens通过评估大型视觉-语言模型在城市社会经济指标预测中的表现,揭示了其在可持续城市发展中的潜力与局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01225 2026-03-03 cs.CL 70%

Can Thinking Models Think to Detect Hateful Memes?

思考模型能否通过思考来检测仇恨言论?

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Qatar University(卡塔尔大学) Qatar Computing Research Institute(卡塔尔计算研究中心)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出基于强化学习的后训练框架,通过任务特定奖励和GRPO目标提升基于思考的多模态模型在检测仇恨言论中的推理能力,实验表明在准确性、F1值和解释质量上均有显著提升。

Journal ref In Companion Proceedings of the ACM Web Conference 2026 (WWW Companion 26), April 13-17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15498 2026-03-03 cs.CL cs.AI cs.LG 67%

SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling

SPARE:基于参考引导评估的单次标注用于自动过程监督与奖励建模

Md Imbesat Hassan Rizvi, Xiaodan Zhu, Iryna Gurevych

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPARE通过单次生成与参考引导评估,实现高效过程标注,提升LLM多步推理中的奖励建模与微调效果。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏