arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2607.02007 2026-07-03 cs.CL cs.CV 新提交 88%

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

EduArt:评估大型语言模型艺术史知识的教育级基准

Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

机构 * University of Bologna(博洛尼亚大学) Villa i Tatti – The Harvard University Center for Italian Renaissance Studies(哈佛大学意大利文艺复兴研究中心(I Tatti)) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出EduArt基准,包含871道人工出题的艺术史题目,评估多模态大模型在不同格式和语言下的知识掌握与推理能力,发现格式显著影响表现,多选题高估模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01612 2026-07-03 cs.AI 新提交 88%

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

自信地扩展:校准LLM的置信度以实现自适应测试时扩展

Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出C3RL算法,通过结合正确性、校准和数据集参考准确率奖励来校准LLM的置信度,并基于此引入CAS策略,根据置信度自适应分配推理计算资源,在提升校准性的同时降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29815 2026-06-30 cs.CL 88%

SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models

SrDetection: 一种用于代码大型语言模型中数据泄露检测的自参考框架

Shuaimin Li, Liyang Fan, Zeyang Li, Zhuoyue Wan, Yufang Lin, Shiwen Ni, Feiteng Fang, Hamid Alinejad-Rokny, Yuanfeng Song, Kun Jing, Chen Jason Zhang, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University(深圳大学) University of Science and Technology of China(中国科学技术大学) PolyU(香港理工大学) East China Normal University(华东师范大学) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳大学先进技术研究院人工智能研究所) University of New South Wales(新南威尔士大学) Anhui University(安徽大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出自参考框架SrDetection,通过对比模型对原始样本与语义等价变体的行为差异检测数据泄露,在灰盒和黑盒设置下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11534 2026-06-30 cs.CL cs.CY 88%

Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models

人工智能中的物种歧视:评估大型语言模型对动物的歧视

Monika Jotautaitė, Lucius Caviola, David A. Brewster, Thilo Hagendorff

机构 * Independent(独立学者) University of Cambridge(剑桥大学) Harvard University(哈佛大学) University of Stuttgart(斯图加特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究评估大型语言模型是否表现出基于物种的歧视倾向,发现其在识别物种歧视言论方面可靠但较少谴责,且在文本生成中倾向于合理化对农场动物的伤害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02351 2026-06-30 cs.CL 88%

Generative Large Language Models in Automated Fact-Checking: A Survey

生成式大语言模型在自动事实核查中的应用:综述

Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述了生成式大语言模型在自动事实核查中的作用,分析了其在事实验证、数据生成及评估中的应用,探讨了多语言和低资源环境下的挑战与趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24980 2026-06-25 cs.LG 新提交 88%

Closed-Loop Graph Algorithm Execution with Small Language Models: Step Accuracy and Rollout Reliability

使用小型语言模型的闭环图算法执行:步骤准确性与推出可靠性

Michal Podstawski

机构 * NASK National Research Institute(NASK国家研究所)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 研究小型语言模型在闭环中执行图算法的能力,发现结构算法可适应可靠,但加权算法对误差累积敏感,强预测不保证可靠执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19157 2026-06-25 eess.AS cs.CL 新提交 88%

IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages

IndicContextEval:评估8种印度语言音频大语言模型上下文利用能力的基准

Sakshi Joshi, Dhruv Subhash Rathi, Sanskar Singh, Eldho Ittan George, R J Hari, Kaushal Bhogale, Mitesh M. Khapra

机构 * AI4Bharat, Indian Institute of Technology Madras, India(AI4Bharat,印度理工学院马德拉斯分校) Sarvam AI, India(Sarvam AI,印度)

专题命中 评测与基准 :large language model(title);language model(title);pretraining(abstract);prompting(abstract)

AI总结 提出IndicContextEval基准,包含8种印度语言555位说话人的56小时自然语音,通过7级提示框架评估音频大语言模型是否真正利用上下文而非依赖参数化知识。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24370 2026-06-24 cs.AI cs.CY 新提交 88%

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复

Hiroshi Okumura

机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) Kobe University(北九州市立大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。

Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 88%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09013 2026-06-23 cs.CL 新提交 88%

Beyond Averages: Evaluating LLMs on Human Survey Replication at the Distributional Level

超越平均值:在分布层面评估LLM对人类调查的复现能力

Jeonghyeon Moon, Jiwon Kim, Yeheum Lah, Yoonju Han, Yuncheol Kang

机构 * Ewha Womans University(梨花女子大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 本研究通过非公开的韩国方便面购买实验,在分布层面评估LLM复现人类调查响应的能力,发现均值匹配的模型可能产生更偏离人类的分布,且结构化角色和多模态输入提升对齐度,而推理提示则降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13864 2026-06-23 cs.CR cs.AI 版本更新 88%

HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试

Qirui Chen, Jingxian Shuai, Shuangwu Chen, Shenghao Ye, Zijian Wen, Xufei Su, Jie Jin, Jiangming Li, Jun Chen, Xiaobin Tan, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) ZTE Corporation(中兴通讯)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19868 2026-06-19 cs.AI 新提交 88%

A Systematic Evaluation of Black-Box Uncertainty Estimation Methods for Large Language Models

大型语言模型黑盒不确定性估计方法的系统评估

Jiayi Wang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 系统评估了24种黑盒不确定性估计方法在4个模型和4个数据集上的表现,发现无单一方法普遍最优,但基于答案空间推理和比较的方法通常有效,混合方法在多数条件下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-06-17 cs.NI cs.AI cs.CR 版本更新 88%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 49 pages, 15 figures, 6 tables; survey article

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22184 2026-06-17 cs.GT cs.LG cs.MA 版本更新 88%

Tacit Coordination of Large Language Models

大型语言模型的隐性协调

Ido Aharon, Emanuele La Malfa, Michael Wooldridge, Sarit Kraus

机构 * Department of Computer Science, Bar-Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Institute for Decentralized AI (IDAI)(去中心化人工智能研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究大型语言模型在多智能体无通信协调中的焦点涌现能力,通过博弈和搜救任务评估,发现模型在多数场景匹配或超越人类,但在数值常识和文化显著性任务中失败,并提出无学习策略改善协调。

Comments Code: https://github.com/EmanueleLM/focal-points

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15890 2026-06-16 cs.AI 新提交 88%

UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics

UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试

Yanxin Xi, Xiang Su, Jie Feng, Yu Liu, Sasu Tarkoma, Pan Hui

机构 * University of Helsinki(赫尔辛基大学) Zhongguancun Academy(中关村学院) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出UrbanWell基准,通过卫星和街景图像联合建模,系统评估多模态大语言模型在环境、空间可达性、城市形态、活力和主观感知等5类城市福祉指标上的时空推理能力,并定义时序预测和趋势分类任务。

Comments accepted by KDD Datasets and Benchmarks Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00955 2026-06-16 cs.CL cs.SD eess.AS 88%

Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection

利用大语言模型进行讽刺语音标注在讽刺检测中的应用

Zhu Li, Yuqing Zhang, Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * University of Groningen(Groningen大学) Speech Technology Lab(语音技术实验室) Center for Language and Cognition(语言与认知中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出利用大语言模型生成讽刺语音数据集,通过人类验证提升标注质量,并在公开数据集上验证了检测性能,最终引入PodSarc数据集,实现了73.63%的F1分数。

Comments Interspeech 2025; Project page: https://github.com/Abel1802/PodSarc

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20709 2026-06-16 cs.SE cs.AI cs.CR 版本更新 88%

DualGauge: Automated Joint Security-Functionality Benchmarking of Specification-Only Code Generation by LLMs and Coding Agents

DualGauge: 对仅由LLM和编码代理生成的规范代码进行自动化联合安全-功能基准测试

Rupam Patir, Keyan Guo, Suvadra Barua, Abhijeet Pathak, Dinesh Gudimetla, Jiawei Guo, Hongxin Hu, Haipeng Cai

机构 * University at Buffalo, SUNY(布法罗大学)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 提出DualGauge框架,首个自动化联合评估规范代码正确性与安全性的系统,通过307个任务基准测试发现功能正确性高估可靠代码生成,联合成功率低于15%,且模型因素和代理系统均无法可靠提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23688 2026-06-16 cs.CL cs.HC 版本更新 88%

Mapping Geopolitical Bias in 11 Large Language Models: A Bilingual, Dual-Framing Analysis of U.S.-China Tensions

映射11个大语言模型中的地缘政治偏见:美中紧张局势的双语、双框架分析

William Guey, Wei Zhang, Pierrick Bougault, Vitor D. de Moura, José O. Gomes

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) School of Social Sciences, Tsinghua University(清华大学社会科学部) Department of Industrial Engineering, Federal University of Rio de Janeiro(里约热内卢联邦大学工业工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过引入调查心理测量学的平衡键控方法,量化11个模型在2种语言中对美中地缘政治问题的立场,发现开发者起源、查询语言和议题领域是三个近等加性因素,所有模型在中文下更亲华。

Comments 37 pages, 6 main-text figures, 12 supplementary figures, 5 supplementary tables; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21036 2026-06-16 cs.CL 版本更新 88%

GePBench: Evaluating Fundamental Geometric Perception for Multimodal Large Language Models

GePBench:评估多模态大语言模型的基础几何感知能力

Shangyu Xing, Changhao Xiang, Yuteng Han, Yifan Yue, Zhen Wu, Xinyu Liu, Zhangtai Wu, Fei Zhao, Xinyu Dai

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出GePBench基准,系统评估多模态大语言模型的几何形状识别与空间关系感知能力,发现现有模型存在显著缺陷,而基于该基准训练可提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12599 2026-06-12 cs.CL 新提交 88%

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

通过波斯谚语条件故事生成实现LLM中的约束语义解压缩

Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12422 2026-06-12 cs.CY cs.AI cs.HC 新提交 88%

Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering

通过上下文工程创建和评估K-12生成式AI评分器

Zewei Tian, Alex Liu, Lief Esbenshade, Michael Xiao, Zachary Zhang, Yulia Lápicus, Thomas Han, Kevin He, Min Sun

机构 * University of Washington(华盛顿大学) Colleague AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究通过上下文工程利用商用基础模型构建LLM评分器,基于MCAS数据评估其在数学、科学和ELA上的评分一致性,发现大参数模型在数学和科学上表现良好,而ELA上差异较大,表明AI更适合作为形成性工具。

Comments Published on the Proceedings of NCME 2026 Conference (https://www.xcdsystem.com/proceedings/ncme/8DbqHwv/presentation/28064.cfm?uuid=3EC982ED-A989-8E53-B42BC86334206028)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03096 2026-06-12 cs.CL 版本更新 88%

Can Factual Opinions Be Edited (Manipulated) in Large Language Models?

大型语言模型中的事实性观点能否被编辑(操纵)?

Yuanpu Cao, Ziyi Yin, Fenglong Ma, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出FOE基准测试,评估当前知识编辑技术对事实性观点(如公众人物立场)的操纵能力,并发现其仅能实现表面修改,无法保持观点与证据的一致性;进而提出自生成证据对齐方法实现观点-证据对齐。

Comments Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09830 2026-06-11 cs.CL 版本更新 88%

Automated Scoring of Arabic Text Using Large Language Models: A Literature Review

使用大型语言模型对阿拉伯语文本进行自动评分:文献综述

Khaoula Dahimi, Hadda Cherroun, Amel Belabbaci

机构 * Laboratoire d’Informatique et de Mathématiques LIM, Amar Telidji University(阿马尔·特里吉大学计算机与数学实验室)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述了基于大型语言模型的阿拉伯语文本自动评分方法,包括简答题评分和作文评分,提出了包含五个维度的分类体系,并对比分析了现有研究的方法、数据集和性能。

Comments Accepted at NCMAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12327 2026-06-11 cs.CL 版本更新 88%

Neuron-based Personality Trait Induction in Large Language Models

基于神经元的大语言模型人格特质诱导

Jia Deng, Tianyi Tang, Yanbin Yin, Wenhao Yang, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) Tongyi Lab(通义实验室) Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出基于神经元的大语言模型人格特质诱导方法,通过构建PersonalityBench数据集、识别人格相关神经元并调整其值,实现无需训练的参数级控制,效果媲美微调模型。

Comments 25 pages. Published at ICLR 2025

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17254 2026-06-10 cs.AI 版本更新 88%

CatalyticMLLM: A Graph-Text Multimodal Large Language Model for Catalytic Materials

CatalyticMLLM: 一种用于催化材料的图-文本多模态大语言模型

Yanjie Li, Jian Xu, Xu-Yao Zhang, Shiming Xiang, Nian Ran, Weijun Li, Cheng-Lin Liu

机构 * AnnLab(安实验室) Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) Zhongguancun Academy(中关村学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) State Key Laboratory of High Performance Ceramics(高性能陶瓷国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) University of ChineseAcademy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种统一的图-文本多模态大语言模型QE-Catalytic-V2,用于催化材料的性质预测和逆向设计,通过共享的表示空间实现两者的联合建模,从而形成闭环优化流程。

Comments 71 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02323 2026-06-10 cs.CL 版本更新 88%

CoTAL: Human-in-the-Loop Prompt Engineering for Generalizable Formative Assessment Scoring and Feedback

CoTAL:面向可泛化形成性评估评分与反馈的人机协同提示工程

Clayton Cohn, Ashwin T S, Naveeduddin Mohammed, Gautam Biswas

机构 * Vanderbilt University(范德比大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出CoTAL方法,结合证据中心设计、人机协同提示工程和思维链提示,迭代优化LLM评分,在多个领域提升GPT-4评分性能达38.9%,并获师生认可。

Comments Submitted to Computers and Education: Artificial Intelligence. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08948 2026-06-09 cs.CV cs.AI 新提交 88%

NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis

NutriMLLM:用于膳食微量营养素分析的多模态大语言模型

Runze Yan, Minxiao Wang, Jiaying Lu, Darren Liu, Xiao Hu, Hanqi Luo

机构 * Emory University(埃默里大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对现有MLLM在膳食微量营养素估计中不可靠的问题,利用十年人口规模膳食回顾生成约110万图像-营养素三元组,微调Qwen3-VL和GLM-4.6V-Flash得到NutriMLLM,在真实图像上实现65种营养素全覆盖,准确率匹配或超越专有模型。

Comments 35 pages, 10 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08722 2026-06-09 cs.SD cs.CL 新提交 88%

Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding

LLM 能否理解 LilyPond?一个用于符号音乐生成与理解的基准

Matteo Spanio, Mohammad Torabi, Andrea Poltronieri, Antonio Rodà

机构 * University of Padova(帕多瓦大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出 LilyBench,基于 LilyPond 的基准,联合评估开源 LLM 的符号音乐生成与理解能力,实验表明零样本可生成可执行 LilyPond,但结构理解任务仍有挑战,且指标间存在系统性分歧。

Comments Accepted at Ital-IA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07929 2026-06-09 cs.AI 新提交 88%

Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

压力测试医学大语言模型揭示基准准确性之外的潜在安全病理

Yuan Shen, Xiaojun Wu, Linghua Yu

机构 * College of Computer Science and Technology, Zhejiang University, PR China(浙江大学计算机科学与技术学院,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出AI-MASLD压力审计框架,通过240个临床病例和六种叙事扰动探针对七种模型进行双重压力测试,发现量化模型存在伪正常化,医学监督微调损害逻辑稳定性和公平性,开源模型在安全维度上达到或超越闭源模型。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05335 2026-06-09 cond-mat.dis-nn cs.LG 版本更新 88%

Phase transition in large language models and the criticality of natural languages

大型语言模型中的相变与自然语言的临界性

Kai Nakaishi, Yoshihiko Nishikawa, Koji Hukushima

机构 * Center for Advanced Intelligence Project, RIKEN(先进智能项目中心,理化学研究所) National Institute for Japanese Language and Linguistics(日本语言学研究所) Department of Physics, Nagoya University(名古屋大学物理系) Department of Multidisciplinary Sciences, The University of Tokyo(东京大学多学科科学系) Komaba Institute for Science, The University of Tokyo(东京大学Komaba科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 通过将大型语言模型作为可控有效模型,发现当调节类似物理温度的参数时,模型经历相变,临界点生成的文本呈现幂律行为,最接近自然语言,表明自然语言具有临界性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏