arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2504.19254 2026-01-29 cs.CL cs.AI cs.LG 90%

Uncertainty Quantification for Language Models: A Suite of Black-Box, White-Box, LLM Judge, and Ensemble Scorers

语言模型的不确定性量化:一套黑盒、白盒、LLM评判者和集成评分器

Dylan Bouchard, Mohit Singh Chauhan

机构 * CVS Health(CVS健康公司)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种灵活的框架,利用黑盒、白盒、LLM评判者和集成评分器来检测语言模型的幻觉问题,通过可调节的集成方法提升检测性能。

Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19925 2026-01-29 cs.CL cs.AI 90%

Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study

评估大型语言模型用于抽象评估任务:一项实证研究

Yinuo Liu, Emre Sezgin, Eric A. Youngstrom

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在摘要评估任务中的表现,发现其在客观标准上与人类评审员一致,但在主观维度上表现较弱,表明AI可作为补充工具。

Comments 17 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20727 2026-01-29 cs.CY 89%

Audit Trails for Accountability in Large Language Models

为大型语言模型问责制设计的审计追踪

Victor Ojewale, Harini Suresh, Suresh Venkatasubramanian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出了一种用于大型语言模型的审计追踪机制,通过生命周期框架和参考架构,实现持续问责,提供可重用的开源实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20546 2026-01-29 cs.CL 88%

Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models

超越发散性创造:基于人类的大型语言模型创造力评估

Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CDAT任务,基于人类创造力理论,评估LLMs在新颖性与适当性之间的平衡,发现较小模型更具创造力,而高级模型更注重适当性。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 88%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04715 2026-01-29 cs.CL cs.AI cs.LG 87%

First is Not Really Better Than Last: Evaluating Layer Choice and Aggregation Strategies in Language Model Data Influence Estimation

首先并非真的优于最后:评估语言模型数据影响估计中的层数选择和聚合策略

Dmytro Vitel, Anshuman Chhabra

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过理论和实证分析,证明中间注意力层比第一层更有效,提出新的噪声检测率度量标准,挑战传统影响估计方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08734 2026-01-29 cs.CL 86%

NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context

NurValues: 临床情境下大型语言模型护理价值观的现实评估

Ben Yao, Qiuchi Li, Yazhou Zhang, Siyu Yang, Bohan Zhang, Prayag Tiwari, Jing Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Copenhagen(哥本哈根大学) Tianjin University(天津大学) Tongji Hospital of Tongji Medical College of Huazhong University of Science and Technology(华中科技大学同济医学院同济医院) Beijing University of Chinese Medicine(北京中医药大学) Halmstad University(哈马尔大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 NurValues通过首个护理价值对齐基准,评估LLMs在临床情境中是否符合护理核心价值观,发现通用LLMs在公正维度表现最差。

Comments 39 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19904 2026-01-29 cs.AR cs.AI cs.CL cs.DC cs.PF 86%

DABench-LLM: Standardized and In-Depth Benchmarking of Post-Moore Dataflow AI Accelerators for LLMs

DABench-LLM: 大规模语言模型后摩尔数据流AI加速器的标准化与深入基准测试

Ziyu Hu, Zhiqing Zhong, Weijian Zheng, Zhijing Ye, Xuwei Tan, Xueru Zhang, Zheng Xie, Rajkumar Kettimuthu, Xiaodong Yu

机构 * Dept. of Computer Science Stevens Institute of Technology(计算机科学系 斯坦福理工学院) Dept. of Computer Science Binghamton University(计算机科学系 哈伯里顿大学) Engineering The Ohio State University(工程学 俄亥俄州立大学) Learning Division Argonne National Laboratory(学习部 阿贡国家实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DABench-LLM是一个用于评估数据流AI加速器上LLM工作负载的基准测试框架,通过性能分析和可扩展性研究,揭示性能瓶颈并提供优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10187 2026-01-29 cs.CL cs.AI 86%

HOMURA: Taming the Sand-Glass for Time-Constrained LLM Translation via Reinforcement Learning

HOMURA:通过强化学习驯服沙漏以实现时间受限的LLM翻译

Ziang Cui, Mengran Yu, Tianjiao Li, Chenyu Shi, Yingxuan Shi, Lusheng Zhang, Hongwei Lin

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HOMURA通过强化学习框架优化语义保持与时间合规性平衡,实现精确的翻译长度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19970 2026-01-29 cs.CR cs.LG 85%

Benchmarking LLAMA Model Security Against OWASP Top 10 For LLM Applications

根据OWASP Top 10为LLM应用程序的框架对LLAMA模型安全性能进行基准测试

Nourin Shahin, Izzat Alsmadi

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过对比不同LLama模型的安全性能,发现小型专用模型在威胁检测上表现优于大型通用模型,并提供开源数据集支持AI安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07972 2026-01-29 cs.LG cs.AI cs.CL 85%

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

HeuriGym: 一个用于评估LLM生成启发式算法的代理基准

Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HeuriGym是一个用于评估LLM生成启发式算法的代理基准,通过代码执行反馈和迭代改进,揭示了LLM在组合优化中的局限性。

Comments Accepted to ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20330 2026-01-29 cs.CL cs.LG 84%

PsychePass: Calibrating LLM Therapeutic Competence via Trajectory-Anchored Tournaments

PsychePass:通过轨迹锚定竞赛校准LLM的治疗能力

Zhuang Chen, Dazhen Wan, Zhangkai Zheng, Guanqun Bi, Xiyao Xiao, Binghang Li, Minlie Huang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Lingxin AI(灵心AI) South China Normal University(华南师范大学) CoAI Group, DCST, IAI, BNRIST, Tsinghua University(清华人工智能研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PsychePass通过轨迹锚定竞赛校准LLM的治疗能力,利用动态比赛生成稳定评分并提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20299 2026-01-29 cs.LG cs.AI cs.CL cs.GT 83%

Truthfulness Despite Weak Supervision: Evaluating and Training LLMs Using Peer Prediction

在弱监督下保持真实性:利用同伴预测评估和训练大语言模型

Tianyi Alex Qiu, Micah Carroll, Cameron Allen

机构 * Center for Human-Compatible Artificial Intelligence(兼容人类的人工智能中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过同伴预测方法,利用弱监督提升大语言模型的真实性,有效对抗欺骗并增强评估可靠性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19956 2026-01-29 eess.AS cs.AI cs.SD 83%

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

VoxPrivacy:评估语音语言模型交互隐私的基准

Yuxiang Wang, Hongyu Liu, Dekun Chen, Xueyao Zhang, Zhizheng Wu

专题命中 评测与基准 :language model(title,abstract);SLM(abstract);分类 cs.AI

AI总结 VoxPrivacy是首个评估语音语言模型交互隐私的基准,揭示了多数模型在隐私决策上的薄弱环节,并通过微调提升隐私保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13980 2026-01-29 cs.CL 83%

Structure-Aware Decoding Mechanisms for Complex Entity Extraction with Large-Scale Language Models

具有结构意识的解码机制用于大规模语言模型的复杂实体提取

Zhimin Qiu, Di Wu, Feng Liu, Yuxiao Wang

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种基于大规模语言模型的结构意识解码方法,用于提升复杂实体提取任务的精度与结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19916 2026-01-29 cs.CL 81%

PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review

PaperAudit-Bench: 用于关键自动化同行评审中研究论文错误检测的基准测试

Songjun Tu, Yiwen Ma, Jiahao Lin, Qichao Zhang, Xiangyuan Lan, Junfeng. Li, Nan Xu, Linjing Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Wenge Technology(文英科技)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 PaperAudit-Bench通过整合结构化错误检测与证据意识的评审生成,提升自动化同行评审的批判性评估能力,并支持轻量级模型训练以实现高效错误检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17087 2026-01-29 cs.HC cs.AI cs.CY cs.LG 81%

Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations

陷入模拟:LLM模拟用户在代理评估中是不可靠的人类用户代理

Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde, Sameer Singh, Seraphina Goldfarb-Tarrant

机构 * UC Irvine(加州大学欧文分校) Cohere(Cohere公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM模拟用户在代理评估中存在稳健性不足、校准误差和文化差异问题,影响评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20634 2026-01-29 cs.LG 79%

A Foundation Model for Virtual Sensors

虚拟传感器的基础模型

Leon Götz, Lars Frederik Peiss, Erik Sauer, Andreas Udo Sass, Thorsten Bagdonat, Stephan Günnemann, Leo Schwinn

机构 * Volkswagen AG(大众集团) Technical University of Munich(慕尼黑技术大学) Helmholtz AI(海德堡人工智能研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种虚拟传感器的基础模型,通过统一框架实现高效预测,减少计算和内存需求,提升可解释性与扩展性。

Comments 18 pages in total, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20419 2026-01-29 cs.CV cs.AI 79%

Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models

让我们进行BiFTA:用于视觉语言模型中细粒度文本-视觉对齐的双 refinement

Yuhao Sun, Chengyi Cai, Jiacheng Zhang, Zesheng Ye, Xingliang Yuan, Feng Liu

机构 * School of Computing and Information Systems(计算机与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 BiFTA通过视图和描述细化方法提升视觉语言模型中细粒度文本-视觉对齐的零样本性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11987 2026-01-29 cs.AI 79%

SimBench: A Framework for Evaluating and Diagnosing LLM-Based Digital-Twin Generation for Multi-Physics Simulation

SimBench:用于多物理仿真中基于LLM的数字孪生生成评估与诊断的框架

Jingquan Wang, Andrew Negrut, Hongyu Wang, Harry Zhang, Dan Negrut

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 SimBench是一个用于评估和诊断基于LLM的数字孪生生成能力的框架,适用于多物理仿真场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19935 2026-01-29 cs.CL cs.AI 79%

Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents

Mem2ActBench: 一个评估面向任务的自主代理长期记忆利用的基准

Yiting Shen, Kun Li, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Mem2ActBench是一个评估自主代理利用长期记忆执行任务能力的基准,通过合成工具使用任务验证记忆应用的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16669 2026-01-29 cs.CL cs.AI cs.CY 79%

PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice

PLawBench: 一个基于规则的法律实践评估基准

Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenbo Lv, Weiheng Wu, Kexin Yang, Sen Yang, Wei Wang, Rongyao Shi, Yuanyang Qiu, Yuemeng Qi, Jingwen Zhang, Xiaoyu Sui, Yifan Chen, Yi Zhang, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Weixing Shen, Bing Zhao, Charles L. A. Clarke, Hu Wei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PLawBench通过现实法律任务评估LLM的法律推理能力,揭示其在细节处理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06052 2026-01-29 cs.AI 77%

DCP-Bench-Open: Evaluating LLMs for Constraint Modelling of Discrete Combinatorial Problems

DCP-Bench-Open:评估用于离散组合问题约束建模的LLM

Kostis Michailidis, Dimos Tsouros, Tias Guns

机构 * University of Western Macedonia(希腊西部大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DCP-Bench-Open通过引入多样化问题集评估LLM在约束建模中的能力,发现高级Python框架能显著提升性能,准确率达91%。

Comments This version is currently submitted and it is under review. For CP-Bench (the paper accepted at ECAI25), please refer to the previous version of this entry (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08862 2026-01-29 cs.LG cs.CR 77%

LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs

LLMStinger: 使用强化学习微调的LLM进行LLM劫持

Piyush Jha, Arnav Arora, Vijay Ganesh

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LLMStinger通过强化学习微调LLM,生成对抗性后缀以提高对有害问题的攻击成功率,显著优于现有方法。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20617 2026-01-29 cs.CY cs.AI 77%

Agent Benchmarks Fail Public Sector Requirements

代理基准测试未能满足公共部门要求

Jonathan Rystrøm, Chris Schmitz, Karolina Korgul, Jan Batzner, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Centre for Digital Governance, Hertie School(数字治理中心) Weizenbaum Institute(魏泽瑙研究所) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出公共部门基准测试需满足过程性、现实性、特定性和指标性标准,指出现有基准测试未能全面反映公共部门需求,并呼吁研究人员和公共部门官员共同改进相关评估方法。

Comments Forthcoming @ IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 77%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20102 2026-01-29 cs.CL 77%

Counterfactual Cultural Cues Reduce Medical QA Accuracy in LLMs: Identifier vs Context Effects

反事实文化线索降低大语言模型医学问答准确性:标识符效应与情境效应

Amirhossein Haji Mohammad Rezaei, Zahra Shakeri

机构 * Institute of Health Policy, Management, and Evaluation (IHPME)(健康政策、管理与评估研究所) Dalla Lana School of Public Health(达拉兰公共卫生学院) University of Toronto(多伦多大学) Faculty of Information(信息学院) Schwartz Reisman Institute(施瓦茨-雷曼研究所)

专题命中 评测与基准 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究通过反事实文化线索测试,发现文化相关信息显著降低大语言模型医学问答准确性,尤其在标识符与情境共同存在时影响最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19941 2026-01-29 cs.AR cs.AI cs.PL cs.SE 77%

Bench4HLS: End-to-End Evaluation of LLMs in High-Level Synthesis Code Generation

Bench4HLS: 面向端到端评估LLM在高层次综合代码生成中的表现

M Zafir Sadik Khan, Kimia Azar, Hadi Kamali

机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida(电子与计算机工程系,中央佛罗里达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Bench4HLS通过提供结构化、可扩展的测试平台,评估LLM在高层次综合代码生成中的性能与优化能力。

Comments Accepted to the Design, Automation and Test in Europe Conference (DATE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19927 2026-01-29 cs.CL 77%

Attribution Techniques for Mitigating Hallucinated Information in RAG Systems: A Survey

缓解RAG系统中幻觉信息的归因技术:综述

Yuqing Zhao, Ziyao Liu, Yongsen Zheng, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了RAG系统中缓解幻觉的归因技术,通过分类幻觉类型、统一流程和比较优劣,为实际应用提供指导。

Journal ref The 8th International Conference on Artifcial Intelligence in Information and Communication (ICAIIC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16656 2026-01-29 cs.AI 77%

NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities

NUMINA:多维智能与数值推理能力的自然理解基准

Changyu Zeng, Yifan Wang, Zimu Wang, Wei Wang, Zhengni Yang, Muyi Bao, Jiming Xiao, Anh Nguyen, Yutao Yue

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进技术学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NUMINA是一个用于多维智能和数值推理能力的自然理解基准,通过多尺度注释和自动化注释流程提升多模态室内感知理解,揭示当前LLM在三维空间计算中的不足。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22575--22590

详情

展开后加载摘要…

URL PDF HTML 收藏