arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-05 至 2026-03-05 共收录 241 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2603.03334 2026-03-05 cs.CL 77%

The CompMath-MCQ Dataset: Are LLMs Ready for Higher-Level Math?

CompMath-MCQ数据集:大语言模型是否准备好应对高级数学?

Bianca Raimondi, Francesco Pivi, Davide Evangelista, Maurizio Gabbrielli

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CompMath-MCQ数据集通过多选格式评估LLMs在高级数学推理中的表现,揭示其在复杂计算数学任务上的挑战。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03884 2026-03-05 cs.CL cs.AI 73%

CzechTopic: A Benchmark for Zero-Shot Topic Localization in Historical Czech Documents

CzechTopic: 一个用于历史捷克文档零样本主题定位的基准测试

Martin Kostelník, Michal Hradiš, Martin Dočekal

机构 * Faculty of Information Technology, Brno University of Technology(信息科技学院,布拉格技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CzechTopic提出一个用于历史捷克文档零样本主题定位的基准测试,评估多种模型在主题检测和片段定位上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03683 2026-03-05 cs.SE cs.CL cs.LG 73%

CONCUR: Benchmarking LLMs for Concurrent Code Generation

CONCUR: 评估LLM在并发代码生成中的基准测试

Jue Huang, Tarek Mahmud, Corina Pasareanu, Guowei Yang

机构 * The University of Queensland(昆士兰大学) Texas A&M University - Kingsville(德克萨斯农工大学-国王维尔分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CONCUR是一个专门评估LLM在并发代码生成能力的基准测试,包含115个问题,涵盖基础和变体,用于评估LLM在并发编程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24178 2026-03-05 cs.CL cs.AI 73%

MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations

MuSaG:一个包含完整模态标注的多模态德语讽刺数据集

Aaron Scott, Maike Züfle, Jan Niehues

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MuSaG是一个包含多模态标注的德语讽刺数据集,通过对比人类标注与多种模型性能,揭示了多模态模型在现实场景中的改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13091 2026-03-05 cs.CL cs.AI 73%

LMUnit: Fine-grained Evaluation with Natural Language Unit Tests

LMUnit: 通过自然语言单元测试进行细粒度评估

Jon Saad-Falcon, Rajan Vivek, William Berrios, Nandita Shankar Naik, Matija Franklin, Bertie Vidgen, Amanpreet Singh, Douwe Kiela, Shikib Mehri

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LMUnit通过自然语言单元测试方法提升语言模型评估的细粒度和准确性,实现评估基准中的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04083 2026-03-05 cs.CL 70%

Hindsight Quality Prediction Experiments in Multi-Candidate Human-Post-Edited Machine Translation

多候选人类后编辑机器翻译中的回顾性质量预测实验

Malik Marmonier, Benoît Sagot, Rachel Bawden

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过回顾实验探讨LLMs对机器翻译质量预测范式的影响,发现架构转变改变了预测方法的可靠性并缓解了文档级翻译的挑战。

Comments Accepted to the 2026 Language Resources and Evaluation Conference (LREC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03862 2026-03-05 cs.CL 70%

Assessing the Effectiveness of LLMs in Delivering Cognitive Behavioral Therapy

评估LLMs在提供认知行为疗法中的有效性

Navdeep Singh Bedi, Ana-Maria Bucur, Noriko Kando, Fabio Crestani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了LLMs在模仿专业治疗师进行认知行为疗法方面的能力,发现其在生成对话和传达同理心方面存在局限。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03623 2026-03-05 cs.CL econ.EM 70%

A Neural Topic Method Using a Large-Language-Model-in-the-Loop for Business Research

基于循环大型语言模型的神经主题方法用于商业研究

Stephan Ludwig, Peter J. Danaher, Xiaohao Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LX Topic通过整合大型语言模型细化,提升主题建模的可重复性、可解释性和测量导向性,用于商业研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04111 2026-03-05 cs.CL 70%

MultiWikiQA: A Reading Comprehension Benchmark in 300+ Languages

多语言阅读理解基准测试:MultiWikiQA

Dan Saattrup Smart

机构 * Alexandra Institute(亚历山大研究所)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 MultiWikiQA是一个涵盖306种语言的阅读理解基准测试,通过生成高质量问答对评估不同语言模型的性能。

Comments Camera-ready version for LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06803 2026-03-05 cs.CL cs.MA 70%

SEVADE: Self-Evolving Multi-Agent Analysis with Decoupled Evaluation for Hallucination-Resistant Irony Detection

SEVADE:基于解耦评估的自演化多智能体分析用于抗幻觉讽刺检测

Ziqi Liu, Ziyang Zhou, Yilin Li, Mingxuan Hu, Yushan Pan, Zhijie Xu, Yangbin Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SEVADE通过自演化多智能体分析框架,结合解耦评估机制,提升抗幻觉讽刺检测的准确率和宏F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22263 2026-03-05 cs.LG 70%

Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning

擦除或隐藏?抑制虚假的反向学习神经元以实现稳健的反向学习

Nakyeong Yang, Dong-Kyum Kim, Jea Kwon, Minsung Kim, Kyomin Jung, Meeyoung Cha

机构 * Seoul National University(首尔国立大学) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Ssiuu方法,通过属性引导正则化有效抑制虚假反向学习神经元,提升反向学习的鲁棒性和准确性。

Comments accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03985 2026-03-05 cs.CV 67%

RIVER: A Real-Time Interaction Benchmark for Video LLMs

RIVER:面向视频大语言模型的实时交互基准

Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang

机构 * School of Information Science And Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) State Key Lab of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 RIVER基准通过引入实时交互任务框架,改进视频大语言模型的实时交互能力,提升长期记忆与未来感知表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03871 2026-03-05 cs.CV 67%

Bridging Human Evaluation to Infrared and Visible Image Fusion

将人类评估与红外与可见图像融合相结合

Jinyuan Liu, Xingyuan Li, Qingyun Mei, Haoyuan Xu, Zhiying Jiang, Long Ma, Risheng Liu, Xin Fan

机构 * School of Mechanical Engineering, Dalian University of Technology(大连理工大学机械工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology & DUT-RU International School of ISE, Dalian University of Technology(大连理工大学软件学院) College of Information Science and Technology, Dalian Maritime University(大连海事大学信息科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种反馈强化框架,通过引入大规模人类反馈数据集和领域特定奖励函数,提升红外与可见图像融合的感知质量,使其更符合人类审美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13943 2026-03-05 cs.CV 67%

From Press to Pixels: Evolving Urdu Text Recognition

从报纸到像素:进化乌尔都语文本识别

Samee Arif, Sualeha Farid

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出通过微调YOLO和SwinIR模型,结合UNB数据集,对比LLMs与传统OCR在乌尔都语识别中的性能,展示LLMs在低资源场景下的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11371 2026-03-05 cs.IR 67%

RAG vs. GraphRAG: A Systematic Evaluation and Key Insights

RAG与GraphRAG:系统评估与关键洞察

Haoyu Han, Li Ma, Yu Wang, Harry Shomer, Yongjia Lei, Zhisheng Qi, Kai Guo, Zhigang Hua, Bo Long, Hui Liu, Charu C. Aggarwal, Jiliang Tang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文系统评估RAG与GraphRAG在文本任务中的表现,提出统一评估协议,揭示两者优势与权衡,并探索整合策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04238 2026-03-05 cs.CL 65%

Retrieval or Representation? Reassessing Benchmark Gaps in Multilingual and Visually Rich RAG

检索还是表示?重新评估多语言和视觉丰富的RAG基准差距

Martin Asenov, Kenza Benkirane, Dan Goldwater, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel AI实验室)

专题命中 评测与基准 :language model(abstract,comments);分类 cs.CL;large language model(comments)

AI总结 该研究通过系统分析发现,文档表示质量是多语言和视觉丰富RAG基准提升的主要因素,而非检索方法改进。

Comments ICLR 2026 Workshop I Can't Believe It's Not Better: Where Large Language Models Need to Improve

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04356 2026-03-05 cs.RO cs.AI cs.LG 62%

RoboCasa365: A Large-Scale Simulation Framework for Training and Benchmarking Generalist Robots

RoboCasa365:一种大规模仿真框架,用于训练和评估通用机器人

Soroush Nasiriany, Sepehr Nasiriany, Abhiram Maddukuri, Yuke Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA Research(NVIDIA研究)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 RoboCasa365通过大规模仿真框架提供多样化任务和环境,用于训练和评估通用机器人,分析任务多样性、数据集规模和环境变化对泛化的影响。

Comments ICLR 2026; First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01222 2026-03-05 cs.CL cs.AI 62%

WebDS: An End-to-End Benchmark for Web-based Data Science

WebDS: 一种端到端的基于网络的数据科学基准

Ethan Hsu, Hong Meng Yam, Ines Bouissou, Aaron Murali John, Raj Thota, Josh Koe, Vivek Sarath Putta, G K Dharesan, Alexander Spangher, Shikhar Murty, Tenghao Huang, Christopher D. Manning

机构 * Stanford University(斯坦福大学) Pinetree Research(Pinetree研究公司) University of California, Berkeley(加州大学伯克利分校) Singapore University of Technology and Design(新加坡科技设计大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 WebDS提出了一种端到端的基于网络的数据科学基准,旨在评估代理在复杂多步骤任务中的表现,揭示当前LLM在实际数据科学任务中的性能差距。

Comments 14 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03306 2026-03-05 cs.CL cs.AI 62%

Token-Oriented Object Notation vs JSON: A Benchmark of Plain and Constrained Decoding Generation

以标记为导向的对象表示法与JSON:一种平滑解码和约束解码生成的基准测试

Ivan Matveev

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了TOON与JSON在生成任务中的表现,发现TOON在特定条件下更高效,但受限于提示开销,而JSON在简单结构中表现更优。

Comments 9 pages, 2 figures, 2 tables. Benchmark code and data available at https://github.com/vetertann/TOON-generation-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04325 2026-03-05 cs.CV cs.LG 57%

Scalable Evaluation of the Realism of Synthetic Environmental Augmentations in Images

可扩展性评估合成环境增强图像的真实性

Damian J. Ruck, Paul Vautravers, Oliver Chalkley, Jake Thomas

机构 * Advai Ltd(Advai有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种可扩展框架,用于评估合成环境增强图像的真实性,发现生成式AI在大多数条件下优于基于规则的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03761 2026-03-05 cs.AI cs.IR 57%

AgentSelect: Benchmark for Narrative Query-to-Agent Recommendation

AgentSelect: 用于叙述查询到代理推荐的基准测试

Yunxiao Shi, Wujiang Xu, Tingwei Chen, Haoning Shang, Ling Yang, Yunfeng Wan, Zhuo Cao, Xing Zi, Dimitris N. Metaxas, Min Xu

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 AgentSelect是一个用于叙述查询到代理推荐的基准测试,通过统一的数据和评估基础设施,填补了代理推荐领域的研究空白,展示了基于能力匹配的代理推荐方法。

Comments under review by conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01508 2026-03-05 cs.CY cs.AI 57%

The Sentience Readiness Index: A Preliminary Framework for Measuring National Preparedness for the Possibility of Artificial Sentience

意识准备指数:衡量国家应对人工智能意识可能性准备程度的初步框架

Tony Rost

机构 * The Harder Problem Project(harder problem 项目)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出意识准备指数,用于衡量国家应对AI意识可能性的准备程度,发现当前社会在制度、专业和文化基础设施方面不足。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17110 2026-03-05 cs.CV cs.LG 57%

Beyond Accuracy: What Matters in Designing Well-Behaved Image Classification Models?

超越准确率:设计良好行为图像分类模型所关注的问题

Robin Hesse, Doğukan Bağcı, Bernt Schiele, Simone Schaub-Meyer, Stefan Roth

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文研究了图像分类模型在鲁棒性、校准和公平性等质量维度上的表现,提出QUBA指标以评估和推荐模型。

Comments Published in TMLR (01/2026) | OpenReview: https://openreview.net/forum?id=E7HDtLCoT6 | Project page: https://visinf.github.io/beyond-accuracy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17204 2026-03-05 cs.LG cs.CE 57%

SpecBridge: Bridging Mass Spectrometry and Molecular Representations via Cross-Modal Alignment

SpecBridge: 通过跨模态对齐弥合质谱与分子表示

Yinkai Wang, Yan Zhou Chen, Xiaohui Chen, Li-Ping Liu, Soha Hassoun

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 SpecBridge通过跨模态对齐方法提升质谱数据中分子鉴定的准确性,利用冻结的基础模型实现高效检索。

Comments We have found a problem in the preprocessing/evaluation pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04240 2026-03-05 cs.CV 50%

DeNuC: Decoupling Nuclei Detection and Classification in Histopathology

DeNuC:解耦组织病理学中的核检测与分类

Zijiang Yang, Chen Kuang, Dongmei Fu

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(自动化与电气工程学院,北京科技大学) University of Science and Technology Beijing(北京科技大学) Beijing Engineering Research Center of Industrial Spectrum Imaging(工业光谱成像工程研究中心)

专题命中 评测与基准 :foundation model(abstract)

AI总结 DeNuC通过解耦核检测与分类,提升病理图像中核检测与分类的性能,显著优于现有方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18349 2026-03-05 cs.CV 50%

Human-Object Interaction via Automatically Designed VLM-Guided Motion Policy

通过自动设计的VLM引导运动策略实现人-物交互

Zekai Deng, Ye Shi, Kaiyang Ji, Lan Xu, Shaoli Huang, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) AgiBot

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种基于VLMs的统一物理框架,通过自动设计的RMD方法实现人-物交互合成,提升了运动生成的自然性和通用性。

Comments iclr camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17034 2026-03-05 cs.RO cs.NE 50%

Evolution 6.0: Robot Evolution through Generative Design

进化6.0:通过生成设计实现机器人进化

Muhammad Haris Khan, Artyom Myshlyaev, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 进化6.0通过生成式AI实现机器人自主设计工具和执行任务,展示高成功率和泛化能力。

Comments Accepted to HRI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 43 篇

2603.04292 2026-03-05 cs.CL 90%

Position: Vector Prompt Interfaces Should Be Exposed to Enable Customization of Large Language Models

位置:应暴露向量提示接口以实现大语言模型的定制

Liangwei Yang, Shiyu Wang, Haolin Chen, Rithesh Murthy, Ming Zhu, Jielin Qiu, Zixiang Chen, Juntao Tan, Jianguo Zhang, Zhiwei Liu, Wenting Zhao, Silvio Savarese, Caiming Xiong, Huan Wang, Shelby Heinecke

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文主张通过暴露向量提示接口实现大语言模型的定制化,指出向量提示微调优于文本提示优化,并强调在现实部署中仅推理的定制需求增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15374 2026-03-05 cs.IR cs.AI cs.CL 90%

Leveraging Large Language Models for Semantic Query Processing in a Scholarly Knowledge Graph

利用大语言模型在学术知识图谱中进行语义查询处理

Runsong Jia, Bowen Zhang, Sergio J. Rodríguez Méndez, Pouya G. Omran

机构 * Australian National University(澳大利亚国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型与学术知识图谱结合,提升语义查询处理的准确性和效率,以改进学术研究中的知识管理与发现。

Comments for the associated repository, see http://w3id.org/kgcp/KGQP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03310 2026-03-05 cs.CL cs.LG 90%

Entropic-Time Inference: Self-Organizing Large Language Model Decoding Beyond Attention

熵-时间推断:超越注意力的自组织大语言模型解码

Andrew Kiruluta

机构 * School of Information(信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出熵-时间推断方法,通过自组织架构实现基于熵的解码优化,提升大语言模型推理效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏