arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 83 篇

2510.15955 2026-01-27 cs.LG cs.AI 79%

How Good Are LLMs at Processing Tool Outputs?

大型语言模型在处理工具输出方面有多好?

Kiran Kate, Yara Rizk, Poulami Ghosh, Ashu Gulati, Tathagata Chakraborti, Zidane Wright, Mayank Agarwal

机构 * IBM Research(IBM研究院) Persistent Systems Grab

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs处理工具输出的能力,发现即使在前沿模型上,JSON处理仍具挑战性,不同提示策略影响性能差异达3%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04472 2026-01-27 cs.CL cs.AI 79%

RECAP: REwriting Conversations for Intent Understanding in Agentic Planning

RECAP:用于代理规划中意图理解的对话重写

Kushan Mitra, Dan Zhang, Hannah Kim, Estevam Hruschka

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过对话重写提升代理规划中的意图理解,提出新基准和方法,验证重写对规划效用的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17614 2026-01-27 cs.HC 78%

AlignUI: A Method for Designing LLM-Generated UIs Aligned with User Preferences

AlignUI: 一种用于设计与用户偏好一致的LLM生成UI的方法

Yimeng Liu, Misha Sra, Chang Xiao

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 AlignUI通过用户偏好数据集引导LLM生成与用户任务和偏好一致的UI,提升UI设计与用户需求的匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14506 2026-01-27 cs.RO 78%

InteLiPlan: An Interactive Lightweight LLM-Based Planner for Domestic Robot Autonomy

InteLiPlan:一种交互式轻量级基于大语言模型的规划器,用于家用机器人自主性

Kim Tien Ly, Kai Lu, Ioannis Havoutis

机构 * Middlesex University(中塞克斯大学) Oxford Robotics Institute, University of Oxford(牛津机器人研究所,牛津大学)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 InteLiPlan是一种基于大语言模型的轻量级交互式规划器,通过实时机载计算实现家用机器人自主性和鲁棒性的提升,成功完成95%的任务执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18091 2026-01-27 cs.LG 77%

From LLMs to LRMs: Rethinking Pruning for Reasoning-Centric Models

从大语言模型到大推理模型:重新思考面向推理中心模型的剪枝

Longwei Ding, Anhao Zhao, Fanghua Ye, Ziyang Chen, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) Tencent Hunyuan / AI Lab(腾讯文英/人工智能实验室) Université Paris Dauphine - PSL(巴黎-萨克勒大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了推理增强模型的剪枝策略,发现深度剪枝在分类任务中表现更优,而宽度剪枝在生成和推理中更稳健,静态剪枝更利于保持推理性能。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16891 2026-01-27 cs.AI 77%

LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation

LLMs作为布局设计师:增强的空间推理用于内容感知布局生成

Sha Li, Stefano Petrangeli, Yu Shen, Xiang Chen, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LaySPA通过强化学习框架增强LLM的空间推理能力,实现内容感知布局生成,优于通用LLM和专用布局模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17897 2026-01-27 cs.AI 77%

UniCog: Uncovering Cognitive Abilities of LLMs through Latent Mind Space Analysis

UniCog: 通过潜在思维空间分析揭示大语言模型的认知能力

Jiayu Liu, Yinhe Long, Zhenya Huang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UniCog通过潜在思维空间分析揭示大语言模型的认知能力,提出统一框架并提升推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17530 2026-01-27 cs.CL 77%

Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes

用ConLLM揭示真相以检测多模态深度伪造

Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Bharati Vidyapeeth’s College Of Engineering(巴里蒂大学工程学院) Vivekananda Institute of Professional Studies (VIPS)(维维kananda专业研究学院) DSEU-Okhla Center for SDGC(SDGC研究中心) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ConLLM通过对比学习和大语言模型推理,有效提升多模态深度伪造检测的准确率和泛化能力。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22860 2026-01-27 cs.CL q-bio.NC 77%

Far from the Shallow: Brain-Predictive Reasoning Embedding through Residual Disentanglement

远离浅层:通过残差解耦实现脑预测推理嵌入

Linyang He, Tianjun Zhong, Richard Antonello, Gavin Mischler, Micah Goldblum, Nima Mesgarani

机构 * Zuckerman Mind Brain Behavior Institute, Columbia University(扎克曼脑行为研究所,哥伦比亚大学) Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学) Department of Computer Science, Columbia University(计算机科学系,哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过残差解耦方法,研究实现了对语言推理过程的神经嵌入解耦,揭示了推理在大脑中的独特预测能力及时间特征。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16912 2026-01-27 cs.LG cs.AI cs.CL 75%

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

探索与利用:通过截断、熵和虚假奖励重新思考RLVR

Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

机构 * Columbia(哥伦比亚大学) CUHK SZ(香港大学) DAMO, Alibaba US(阿里云实验室) NYU Stern(纽约大学 Stern 学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过截断、熵和虚假奖励机制,重新审视RLVR框架,揭示了探索与利用权衡对大语言模型推理能力提升的影响。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17743 2026-01-27 cs.CV 75%

VideoPro: Adaptive Program Reasoning for Long Video Understanding

VideoPro: 针对长视频理解的自适应程序推理

Chenglin Li, Feng Han, Yikun Wang, Ruilin Li, Shuai Dong, Haowen Hou, Haitao Li, Qianglong Chen, Feng Tao, Jingqi Tong, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 VideoPro通过自适应程序推理框架提升长视频理解的效率和可靠性,利用快慢推理机制和参数优化在视觉任务中取得更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17263 2026-01-27 cs.GT 75%

Strategic AI in Cournot Markets

Cournot市场中的战略AI

Sanyukta Deshpande, Sheldon H. Jacobson

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了大型语言模型在寡头Cournot市场中的决策行为,揭示其在勾结和定价中的影响,并提出监管策略以恢复市场竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25204 2026-01-27 cs.LG cs.AI cs.CL 75%

Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text Generation

谱logit雕刻:一种自适应低秩logit变换用于受控文本生成

Jin Li, Zhebo Wang, Tianliang Lu, Mohan Li, Wenpeng Xing, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Hangzhou Dianzi University(杭州电子科技大学) People’s Public Security University of China(中国人民公安大学) Guangzhou University(广州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLS通过自适应低秩logit变换优化文本生成,提升输出分布的尖锐度并保持上下文一致性。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16984 2026-01-27 cs.LG cs.AI cs.CL cs.CV cs.IR cs.MM 75%

TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation

TelcoAI: 通过代理多模态检索增强生成技术推进3GPP技术规范搜索

Rahul Ghosh, Chun-Hao Liu, Gaurav Rele, Vidya Sagar Ravipati, Hazar Aouad

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(生成式AI创新中心,亚马逊网络服务)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TelcoAI通过代理多模态检索增强生成技术,提升3GPP技术规范搜索的准确性和效率,实现87%的召回率和16%的性能提升。

Comments Accepted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17982 2026-01-27 cs.CL cs.AI 73%

SD-E$^2$: Semantic Exploration for Reasoning Under Token Budgets

SD-E$^2$: 语义探索用于受限令牌预算下的推理

Kshitij Mishra, Nils Lukas, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 SD-E$^2$通过语义多样性奖励提升小型语言模型在受限令牌预算下的推理能力,实现对复杂问题的高效探索与利用。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17223 2026-01-27 cs.CL cs.AI 73%

Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning

超越结果验证:用于结构化推理的可验证过程奖励模型

Massimiliano Pronesti, Anya Belz, Yufang Hou

机构 * IBM Research Europe - Ireland(IBM欧洲研究院-爱尔兰) Dublin City University(都柏林城市大学) IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出可验证过程奖励模型,用于提升结构化推理的连贯性和准确性,实验显示其在医学证据评估中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14243 2026-01-27 cs.LG cs.CL 73%

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

Jet-RL: 通过统一训练和回放精度流实现基于策略的FP8强化学习

Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Jet-RL通过统一FP8精度流实现稳定高效的强化学习训练,显著提升训练和回放速度,同时保持精度稳定。

Comments 11 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03380 2026-01-27 cs.CL cs.AI 73%

Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning

面向推理导向强化学习的在线难度过滤

Sanghwan Bae, Jiwoo Hong, Min Young Lee, Hanbyul Kim, JeongYeon Nam, Donghyun Kwak

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能研究所) TwelveLabs

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种面向推理导向强化学习的在线难度过滤方法,通过理论分析和实验验证,证明平衡过滤能提升学习效率和样本效率。

Comments To appear in EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18790 2026-01-27 cs.CL 70%

MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts

MortalMATH: 评估推理目标与紧急情境之间的冲突

Etienne Lanzeray, Stephane Meilliez, Malo Ruelle, Damien Sileo

机构 * Univ. Lille(里尔大学) Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MortalMATH研究了推理模型在紧急情境下的表现差异,发现通用模型能拒绝危险任务,而专门模型则忽视危险,导致安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18204 2026-01-27 cs.CL 70%

MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning

MemWeaver: 为可追溯的长 horizon 代理推理编织混合记忆

Juexiang Ye, Xue Li, Xinyu Yang, Chengkai Huang, Lanshun Nie, Lina Yao, Dechen Zhan

机构 * Harbin Institute of Technology(哈尔滨理工大学) The University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemWeaver通过编织混合记忆系统,提升长 horizon 代理推理的准确性与可追溯性,减少输入上下文长度

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21231 2026-01-27 cs.LG cond-mat.mtrl-sci 70%

MiST: Understanding the Role of Mid-Stage Scientific Training in Developing Chemical Reasoning Models

MiST:理解中期科学训练在开发化学推理模型中的作用

Andres M Bran, Tong Xie, Shai Pranesh, Jeffrey Meng, Xuan Vu Nguyen, Jeremy Goumaz, David Ming Segura, Ruizhi Xu, Dongzhan Zhou, Wenjie Zhang, Bram Hoex, Philippe Schwaller

机构 * Laboratory of Artificial Chemical Intelligence (LIAC), Institute of Chemical Sciences and Engineering (ISIC)(人工化学智能实验室(LIAC)、化学科学与工程研究所) National Centre of Competence in Research (NCCR) Catalysis(催化研究国家级竞争力中心) School of Photovoltaic and Renewable Energy engineering(光伏与可再生能源工程学院) School of Computer Science and Engineering(计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Green Dynamics

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MiST通过中期科学训练提升化学推理模型的潜在可解性,显著提高有机反应命名和无机材料生成任务的准确率,同时产生可解释的推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18619 2026-01-27 cs.AI 70%

Visual Attention Reasoning via Hierarchical Search and Self-Verification

通过分层搜索与自验证的视觉注意力推理

Wei Cai, Jian Zhao, Yuchen Yuan, Tianle Zhang, Ming Zhu, Haichuan Tang, Xuelong Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过分层搜索与自验证的视觉注意力推理框架,有效提升多模态大语言模型的视觉定位和推理能力,显著降低幻觉发生率。

Comments The paper is withdrawn by the authors after discovering a flaw in the theoretical derivation presented in the Method section. This incorrect step leads to conclusions that are not supported by the corrected derivation. The authors plan to reconstruct the argument and will release an updated version once the issue is fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17971 2026-01-27 cs.CL 70%

LLMs as Cultural Archives: Cultural Commonsense Knowledge Graph Extraction

LLMs作为文化档案:文化常识知识图谱提取

Junior Cedric Tonga, Chen Cecilia Liu, Iryna Gurevych, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Ubiquitous Knowledge Processing Lab (UKP Lab)(无处不在知识处理实验室) Department of Computer Science(计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) Technische Universität Darmstadt(德累斯顿技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于提示的框架,用于构建文化常识知识图谱,通过LLMs作为文化档案提取文化特定知识,提升文化推理和故事生成性能。

Comments EACL 2026 MAIN

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17706 2026-01-27 cs.CL cs.CV 70%

A Computational Approach to Visual Metonymy

一种视觉隐喻的计算方法

Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于符号学理论的计算方法,通过构建ViMET数据集评估多模态语言模型在理解视觉隐喻方面的认知推理能力,并揭示了机器在处理间接视觉参考上的局限性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17671 2026-01-27 cs.CL 70%

Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning

对齐基准:双语自反馈的多语言数学推理

Chunxu Zhao, Xin Huang, Xue Han, Shujian Huang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research, China Mobile, Beijing, China(JIUTIAN研究, 中国移动, 北京) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室, 南京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PASMR通过基准语言自反馈机制提升多语言数学推理能力,解决LLMs在多语言环境下的性能下降问题。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17435 2026-01-27 cs.SE cs.AI 70%

Towards a Declarative Agentic Layer for Intelligent Agents in MCP-Based Server Ecosystems

迈向基于MCP服务器生态系统的声明性代理层

Maria Jesus Rodriguez-Sanchez, Manuel Noguera, Angel Ruiz-Zafra, Kawtar Benghazi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种声明性代理层,旨在解决基于MCP服务器生态系统中代理工作流的可靠性问题,通过明确的架构结构提升任务执行的可验证性和可重复性。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17346 2026-01-27 cs.AI 70%

Multi-Agent Learning Path Planning via LLMs

通过大型语言模型进行多智能体学习路径规划

Haoxin Xu, Changyong Qi, Tong Liu, Bohao Zhang, Anna He, Bingqian Jiang, Longwei Zheng, Xiaoqing Gu

机构 * Shanghai International Studies University(上海国际 Studies 大学) East China Normal University(华东师范大学) Huaiyin Normal University(淮阴师范学院) City University of Macau(澳门城市大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于LLMs的多智能体学习路径规划框架,通过角色与规则协作机制提升学习路径的透明性与可解释性,实验表明其在路径质量、知识一致性及认知负荷匹配方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12323 2026-01-27 cs.AI 70%

MARO: Learning Stronger Reasoning from Social Interaction

MARO:从社交互动中学习更强的推理能力

Yin Cai, Zhouhong Gu, Juntao Zhang, Ping Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MARO通过多智能体社交环境提升大语言模型的推理能力,解决稀疏信号、角色分布不均和环境不稳定问题,实验显示其在社交推理和跨任务迁移上的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10046 2026-01-27 cs.AI 70%

SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration

SimWorld-Robotics: 为多模态机器人导航与协作合成逼真动态城市环境

Yan Zhuang, Jiawei Ren, Xiaokang Ye, Jianzhi Shen, Ruixuan Zhang, Tianai Yue, Muhammad Faayez, Xuhong He, Ziqiao Ma, Lianhui Qin, Zhiting Hu, Tianmin Shu

机构 * University of Virginia(弗吉尼亚大学) UC San Diego(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 SimWorld-Robotics通过合成逼真动态城市环境,提出两个多模态机器人基准测试,评估机器人在复杂场景中的导航、协作与通信能力。

Comments Conference: NeurIPS 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14305 2026-01-27 cs.CL 70%

MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning

MathMist: 一种用于数学问题解决和推理的平行多语言基准数据集

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Tasnim Mohiuddin, Md Mofijul Islam, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Qatar Computing Research Institute(卡塔尔计算研究所) Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MathMist是一个用于评估多语言数学推理能力的平行多语言基准数据集,涵盖多种语言和资源设置,测试了不同模型在零样本、链式思维等范式下的表现。

Comments Accepted for publication in Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏