arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2603.03241 2026-03-04 cs.CV cs.AI 57%

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

UniG2U-Bench: 统一模型是否能提升多模态理解?

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Liu, Caihua Shan, Yifan Yang, Yifei Shen

机构 * Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03002 2026-03-04 cs.AI 57%

SpatialText: A Pure-Text Cognitive Benchmark for Spatial Understanding in Large Language Models

SpatialText: 一种纯文本的认知基准,用于大型语言模型中的空间理解

Peiyao Jiang, Zequn Qin, Xi Li

机构 * Zhejiang University(浙江大学) School of Software Technology, Zhejiang University(软件技术学院,浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SpatialText通过双源方法为大型语言模型提供纯文本空间认知基准,揭示其在空间推理中的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02766 2026-03-04 cs.AI cs.MA 57%

EvoSkill: Automated Skill Discovery for Multi-Agent Systems

EvoSkill:多智能体系统的自动化技能发现

Salaheddin Alzubi, Noah Provenzano, Jaydon Bingham, Weiyuan Chen, Tu Vu

机构 * Sentient Virginia Tech(弗吉尼亚理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EvoSkill通过自进化框架自动发现和优化多智能体系统的技能,提升在OfficeQA和SealQA等基准测试中的性能,并展示技能在跨任务迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02684 2026-03-04 cs.CL cs.SI 57%

HateMirage: An Explainable Multi-Dimensional Dataset for Decoding Faux Hate and Subtle Online Abuse

HateMirage: 一个可解释的多维数据集用于解码虚假仇恨与微妙的在线虐待

Sai Kartheek Reddy Kasu, Shankar Biradar, Sunil Saumya, Md. Shad Akhtar

机构 * Indian Institute of Information Technology Dharwad(印度信息技术学院达尔瓦德) Manipal Institute of Technology, Manipal Academy of Higher Education(曼普及高等教育学院技术学院) Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术学院德里)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HateMirage 是一个用于解码虚假仇恨与微妙在线虐待的多维数据集,通过多维解释框架提升仇恨言论的可解释性研究。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02557 2026-03-04 cs.CV cs.AI 57%

CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment

CAPT:基于混淆的提示微调以减少视觉-语言不一致

Maoyuan Shao, Yutong Gao, Xinyang Huang, Chuang Zhu, Lijuan Sun, Guoshun Nan

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Library of China, Beijing, China(中国国家图书馆) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CAPT通过引入混淆感知的提示微调框架,有效减少视觉-语言模型中的混淆误差,提升模型判别能力和泛化性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02540 2026-03-04 cs.AI 57%

A Neuropsychologically Grounded Evaluation of LLM Cognitive Abilities

基于神经心理学的大型语言模型认知能力评估

Faiz Ghifari Haznitrama, Faeyza Rishad Ardi, Alice Oh

机构 * School of Computing, KAIST, Daejeon, South Korea(韩国科学技术院计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NeuroCognition基准测试,通过神经心理学测试评估LLM的认知能力,揭示其在图像和复杂任务上的不足,并展示其改进LLM的潜力。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02528 2026-03-04 cs.AI cs.RO 57%

LLM-MLFFN: Multi-Level Autonomous Driving Behavior Feature Fusion via Large Language Model

LLM-MLFFN: 通过大语言模型的多级自动驾驶行为特征融合

Xiangyu Li, Tianyi Wang, Xi Cheng, Rakesh Chowdary Machineni, Zhaomiao Guo, Sikai Chen, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) Systems Engineering Program, Cornell University(康奈尔大学系统工程项目) Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LLM-MLFFN通过大语言模型的多级特征融合提升自动驾驶行为分类的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02345 2026-03-04 cs.SE cs.AI cs.MA 57%

RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection

RIVA: 利用LLM代理进行可靠的配置漂移检测

Sami Abuzakuk, Lucas Crijns, Anne-Marie Kermarrec, Rafael Pires, Martijn de Vos

机构 * EPFL(瑞士洛桑联邦理工学院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 RIVA通过多代理系统和交叉验证技术,提高在工具响应错误时的IaC验证可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02230 2026-03-04 cs.HC cs.AI cs.CY 57%

The Gen AI Generation: Student Views of Awareness, Preparedness, and Concern

生成式人工智能:学生对意识、准备度与担忧的看法

Micaela Siraj, Jon Duke, Thomas Plötz

机构 * Georgia Institute of Technology Atlanta, United States of America(佐治亚理工学院亚特兰大分校,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨学生对生成式人工智能的意识、准备度和担忧,发现接触GenAI的学生成绩更高,但多数学生对伦理和就业影响表示担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01952 2026-03-03 cs.AI 57%

LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations

LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准

Viet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16110 2026-03-03 cs.CV cs.AI 57%

OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis

OmniCT:迈向统一的切片-体积LVLM以实现全面的CT分析

Tianwei Lin, Zhongwei Qiu, Wenqiao Zhang, Jiang Liu, Yihan Xie, Mingjian Gao, Zhenxuan Fan, Zhaocheng Li, Sijing Li, Zhongle Xie, Peng LU, Yueting Zhuang, Ling Zhang, Beng Chin Ooi, Yingda Xia

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云学术院) Hupan Lab(虎派实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniCT提出了一种统一的切片-体积LVLM,通过空间一致性增强、器官级语义增强和MedEval-CT数据集,实现了全面的CT分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04388 2026-03-03 cs.LG 57%

Learning to Orchestrate Agents in Natural Language with the Conductor

通过指挥模型学习自然语言中的代理协调

Stefan Nielsen, Edoardo Cetin, Peter Schwendeman, Qi Sun, Jinglue Xu, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI公司) University of Michigan, USA(美国密歇根大学) Institute of Science Tokyo, Japan(日本东京科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过强化学习训练指挥模型,实现自然语言中代理的协调,展示其在推理基准测试中的卓越性能。

Comments To appear at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06218 2026-03-03 cs.CV cs.AI 57%

EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark

EgoNight: 向夜间视角理解迈进的挑战性基准

Deheng Zhang, Yuqian Fu, Runyi Yang, Yang Miao, Tianwen Qian, Xu Zheng, Guolei Sun, Ajad Chhatkuli, Xuanjing Huang, Yu-Gang Jiang, Luc Van Gool, Danda Pani Paudel

机构 * East China Normal University(东华大学) HKUST(GZ)(香港科技大学(广州)) Nankai University(南开大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EgoNight提出首个夜间视角视觉基准,通过日夜间对齐视频和人工验证构建VQA任务,揭示低光照条件下模型性能下降问题,并引入辅助任务推动模型泛化能力提升。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16395 2026-03-03 cs.CL 57%

OJBench: A Competition Level Code Benchmark For Large Language Models

OJBench: 一个面向大语言模型的竞赛级代码基准

Zhexu Wang, Yiping Liu, Yejie Wang, Wenyang He, Bofei Gao, Muxi Diao, Yanxu Chen, Kelin Fu, Flood Sung, Zhilin Yang, Tianyu Liu, Weiran Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Moonshot AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 OJBench是一个用于评估大语言模型竞赛级代码推理能力的基准,通过232个编程竞赛问题揭示了现有模型在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00960 2026-03-03 cs.CR cs.AI 57%

AWE: Adaptive Agents for Dynamic Web Penetration Testing

AWE:动态网络渗透测试的自适应代理

Akshat Singh Jaswal, Ashish Baghel

机构 * Stux Labs(Stux实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AWE通过内存增强的多代理框架,在动态网络渗透测试中实现高准确性和效率,针对注入类漏洞取得显著成果。

Journal ref Workshop on LLM Assisted Security and Trust Exploration (LAST-X), co-located with NDSS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00938 2026-03-03 cs.CV cs.AI 57%

Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

超越8位:HDR-UGC视频的主观和客观质量评估

Shreshth Saini, Bowen Chen, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * Laboratory for Image and Video Engineering (LIVE), UT Austin(图像与视频工程实验室(LIVE),得克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HDR-Q,首个针对HDR-UGC视频的多模态大语言模型,通过HDR感知编码器和HAPO框架实现超越8位的高质量视频评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00895 2026-03-03 cs.LG 57%

Evaluating AI Grading on Real-World Handwritten College Mathematics: A Large-Scale Study Toward a Benchmark

评估AI在真实世界中的大学数学手写作业评分:迈向基准的大型研究

Zhiqi Yu, Xingping Liu, Haobin Mao, Mingshuo Liu, Long Chen, Jack Xin, Yifeng Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于OCR条件的大语言模型,用于评估真实手写数学作业的AI评分,并建立了一个标准化的基准以支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00285 2026-03-03 cs.AI 57%

TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?

TraderBench: AI代理在对抗性资本市场中的鲁棒性如何?

Xiaochuang Yuan, Hui Xu, Silvia Xu, Cui Zou, Jing Xiong

机构 * Amazon.com Inc.(亚马逊公司) Stony Brook University(石溪大学) Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TraderBench通过结合静态任务与对抗性交易模拟,评估AI代理在动态市场中的鲁棒性,发现现有模型在加密交易中表现稳定但缺乏真实适应性。

Comments Equal Contribution: Xiaochuang Yuan and Hui Xu contributed equally to this work. All correspondence should be directed to yxc20098@gmail.com. Submitted to Agents in the Wild Workshop, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12462 2026-03-03 cs.AI cs.CR 57%

Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems

评估和减轻通信系统中LLM-as-a-judge的偏见

Jiaxin Gao, Chen Chen, Yanwen Jia, Xueluan Gong, Kwok-Yan Lam, Qian Wang

机构 * School of Computer Science and Engineering at Nanyang Technological University(南洋理工大学计算机科学与工程学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了LLM-as-a-judge在通信系统中的偏见问题,分析了不同模型对偏见输入的鲁棒性,并提出四种缓解策略以提高判断的公平性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04080 2026-03-03 cs.CL 57%

PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity

PoLi-RL: 一种用于条件语义文本相似度的点到列表强化学习框架

Zixin Song, Bowen Zhang, Qian-Wen Zhang, Di Yin, Xing Sun, Chunping Li

机构 * Tsinghua University(清华大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PoLi-RL通过点到列表强化学习框架,解决条件语义文本相似度中的优化难题,实现Spearman相关系数达48.18,为复杂条件判断任务提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18487 2026-03-03 cs.CL 57%

Actions Speak Louder than Prompts: A Large-Scale Study of LLMs for Graph Inference

行动胜于提示:大型语言模型在图推断中的大规模研究

Ben Finkelshtein, Silviu Cucerzan, Sujay Kumar Jauhar, Ryen White

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究通过大规模评估揭示LLM在图推断中的表现,发现代码生成在长文本图中表现最佳,异质图上交互策略仍有效,且方法能灵活适应不同输入类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00115 2026-03-03 physics.soc-ph cs.AI cs.CV 57%

Multimodal Modular Chain of Thoughts in Energy Performance Certificate Assessment

多模态模块化思维链在能源性能证书评估中的应用

Zhen Peng, Peter J. Bentley

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模态模块化思维链的低成本EPC预评估方法,通过结构化提示实现对EPC评分的序数结构捕捉,实验表明其在数据稀缺环境下具有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00028 2026-03-03 cs.CL 57%

EPPCMinerBen: A Novel Benchmark for Evaluating Large Language Models on Electronic Patient-Provider Communication via the Patient Portal

EPPCMinerBen:一种用于通过患者门户评估大语言模型在电子患者-提供者沟通中的新基准

Samah Fodeh, Yan Wang, Linhai Ma, Srivani Talakokkul, Jordan M. Alpert, Sarah Schellhorn

机构 * Department of Emergency Medicine, Yale School of Medicine(耶鲁医学院急诊医学部) Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心Lerner学院(凯斯西储大学)) Medical Oncology, Yale School of Medicine(耶鲁医学院肿瘤学部)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EPPCMinerBen是一个用于评估大语言模型在电子患者-提供者沟通中表现的新基准,通过患者门户数据验证了大型模型在证据提取和分类任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23864 2026-03-02 cs.AI 57%

RUMAD: Reinforcement-Unifying Multi-Agent Debate

RUMAD:强化统一多智能体辩论

Chao Wang, Han Lin, Huaze Tang, Huijing Lin, Wenbo Ding

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RUMAD通过强化学习动态控制通信拓扑,提升多智能体辩论的效率和准确性,实现80%以上的token成本降低和跨域泛化能力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21961 2026-03-02 cs.AI cs.HC 57%

How do Visual Attributes Influence Web Agents? A Comprehensive Evaluation of User Interface Design Factors

视觉属性如何影响网络代理?对用户界面设计因素的全面评估

Kuai Yu, Naicheng Yu, Han Wang, Rui Yang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VAF框架,通过系统评估视觉属性对网络代理决策的影响,发现背景颜色对比、项目大小等属性对代理行为有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23840 2026-03-02 cs.CL 57%

Measuring Sycophancy of Language Models in Multi-turn Dialogues

在多轮对话中衡量语言模型的趋炎附势性

Jiseung Hong, Grace Byun, Seungone Kim, Kai Shu, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。

Comments Accepted to Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22955 2026-02-27 cs.CV cs.AI 57%

MM-NeuroOnco: A Multimodal Benchmark and Instruction Dataset for MRI-Based Brain Tumor Diagnosis

MM-NeuroOnco: 一种多模态基准和指令数据集用于基于MRI的脑肿瘤诊断

Feng Guo, Jiaxiang Liu, Yang Li, Qianqian Shi, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Center for Brain-Inspired Computing Research (CBICR), Department of Precision Instrument, Tsinghua University(脑启发计算研究中心(CBICR)、精密仪器系,清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MM-NeuroOnco提出一个多模态数据集和基准,用于提升基于MRI的脑肿瘤诊断的多模态推理能力,通过生成诊断相关语义提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22865 2026-02-27 cs.CL 57%

Effective QA-driven Annotation of Predicate-Argument Relations Across Languages

跨语言有效的问题回答驱动的谓词-论元关系标注

Jonathan Davidov, Aviv Slobodkin, Shmuel Tomi Klein, Reut Tsarfaty, Ido Dagan, Ayal Klein

机构 * Bar-Ilan University(巴伊兰大学) Ariel University(阿里尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种跨语言问题回答驱动的谓词-论元关系标注方法,通过重用英语QA-SRL解析器生成多语言高质量标注数据,提升语义解析效率。

Comments Accepted to EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22703 2026-02-27 cs.LG 57%

Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning

通过翻译引导强化学习增强VLMs的几何感知

Hao Yu, Shuning Jia, Guanghao Li, Wenhao Jiang, Chun Yuan

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 通过翻译引导强化学习提升VLMs的几何感知能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21294 2026-02-27 cs.CL 57%

UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages

UPDESH: 为13种印地语系语言合成基于现实的指令微调数据

Pranjal A. Chitale, Varun Gumma, Sanchit Ahuja, Prashant Kodali, Manan Uppadhyay, Deepthi Sudharsan, Sunayana Sitaram

机构 * Microsoft Corporation(微软公司) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 UPDESH通过基于维基百科内容的自下而上方法,生成高质量的多语言指令数据,提升多语言AI系统的文化适应性与性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏