arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-06 至 2026-02-06 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 15 篇

2602.05381 2026-02-06 cs.AI 92%

Clinical Validation of Medical-based Large Language Model Chatbots on Ophthalmic Patient Queries with LLM-based Evaluation

医学基于大语言模型聊天机器人在眼科患者查询中的临床验证与基于LLM的评估

Ting Fang Tan, Kabilan Elangovan, Andreas Pollreisz, Kevin Bryan Dy, Wei Yan Ng, Joy Le Yi Wong, Jin Liyuan, Chrystie Quek Wan Ning, Ashley Shuen Ying Hong, Arun James Thirunavukarasu, Shelley Yin-His Chang, Jie Yao, Dylan Hong, Wang Zhaoran, Amrita Gupta, Daniel SW Ting

专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了四个医疗LLM在回答眼科患者问题中的表现,发现Meerkat-7B表现最佳,而MedLLaMA3-v20存在大量误导内容,GPT-4-Turbo评分与临床评分一致,表明基于LLM的评估在大规模基准测试中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05059 2026-02-06 cs.AI 90%

Evaluating Large Language Models on Solved and Unsolved Problems in Graph Theory: Implications for Computing Education

在图论中解决和未解决的问题上评估大语言模型:对计算教育的启示

Adithya Kulkarni, Mohna Chakraborty, Jay Bagga

机构 * Department of Computer Science(计算机科学系) Ball State University(巴尔的摩州立大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) Jio Institute(乔研究所)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究评估了大语言模型在图论已解决和未解决问题上的表现,发现其在已有知识探索上有效,但在需要创新数学洞察的任务中存在局限,对计算教育有重要启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05374 2026-02-06 cs.CL cs.LG 90%

Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks

跨语言实证评估大型语言模型在阿拉伯语医疗任务中的表现

Chaimae Abouzahir, Congbo Ma, Nizar Habash, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过跨语言实证分析,揭示了阿拉伯语和英语在医疗问答任务中LLM性能的差异,指出语言驱动的性能差距随任务复杂性增加而加剧,强调了语言意识在医疗任务LLM设计中的重要性。

Comments Accepted to HeaLing-EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04914 2026-02-06 cond-mat.mtrl-sci 85%

From Literature to Lab: Closed-Loop Advancement of Perovskite Solar Cells via Domain Knowledge Guided LLM

从文献到实验室:通过领域知识引导的LLM实现钙钛矿太阳能电池的闭环进步

Penglei Sun, Shuyan Chen, Xiang Liu, Longhan Zhang, Huajie You, Chang Yan, Yongqi Zhang, Xiaowen Chu, Tong-yi Zhang

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过领域知识引导的LLM框架,实现钙钛矿太阳能电池的闭环进步,自主设计出高效配方并接近世界纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05289 2026-02-06 cs.CL cs.AI cs.MA 84%

Towards a Science of Collective AI: LLM-based Multi-Agent Systems Need a Transition from Blind Trial-and-Error to Rigorous Science

迈向集体人工智能的科学:基于LLM的多智能体系统需要从盲目试错转向严谨的科学

Jingru Fan, Dewen Liu, Yufan Dang, Huatao Li, Yuheng Wang, Wei Liu, Feiyu Duan, Xuanwen Ding, Shu Yao, Lin Wu, Ruijie Shi, Wai-Shing Leung, Yuan Cheng, Zhongyu Wei, Cheng Yang, Chen Qian, Zhiyuan Liu, Maosong Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学) King’s College London(伦敦大学国王学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过建立协作收益度量(Γ)和因素归因范式,推动多智能体系统从盲目试错向严谨科学转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05373 2026-02-06 cs.SD 82%

Speech-XL: Towards Long-Form Speech Understanding in Large Speech Language Models

Speech-XL: 向大语言模型中的长形式语音理解迈进

Haoqin Sun, Chenyang Lyu, Shiwan Zhao, Xuanfan Ni, Xiangyu Kong, Longyue Wang, Weihua Luo, Yong Qin

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) Alibaba International Digital Commerce(阿里巴巴国际数字商业) University of Exeter, Exeter, United Kingdom(埃克塞特大学,埃克塞特,英国)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract)

AI总结 Speech-XL通过引入语音摘要标记和课程学习策略,实现长形式语音压缩,提升大语言模型在长音频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05390 2026-02-06 cs.LG cs.AI 81%

Assessing Electricity Demand Forecasting with Exogenous Data in Time Series Foundation Models

基于时间序列基础模型的外生数据电力需求预测评估

Wei Soon Cheong, Lian Lian Jiang, Jamie Ng Suat Ling

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了不同基础模型在电力需求预测中的表现,发现基础模型在某些情况下不如简单基线,强调了模型架构和地理环境对预测效果的影响。

Comments 9 pages, 1 Figure and 3 Tables. Accepted to AI4TS Workshop @ AAAI'26 as an oral presentation (see https://ai4ts.github.io/aaai2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21086 2026-02-06 cs.AI cs.LG 81%

Are foundation models useful feature extractors for electroencephalography analysis?

基础模型在脑电图分析中是否有用的特征提取器?

Özgün Turgut, Felix S. Bott, Markus Ploner, Daniel Rueckert

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich(人工智能在医疗与健康中的研究所,慕尼黑技术大学) Department of Neurology, Technical University of Munich(神经病学系,慕尼黑技术大学) Center for Interdisciplinary Pain Medicine, Technical University of Munich(跨学科疼痛医学中心,慕尼黑技术大学) Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心,德国慕尼黑) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基础模型在脑电图分析中的有效性,发现通用时间序列模型在特征提取上具有竞争力,能有效捕捉生物标志物特征,减少对大规模数据集的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05134 2026-02-06 cs.LG cs.DB 77%

SemPipes -- Optimizable Semantic Data Operators for Tabular Machine Learning Pipelines

SemPipes -- 可优化的语义数据运算符用于表格机器学习流水线

Olga Ovcharenko, Matthias Boehm, Sebastian Schelter

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SemPipes通过LLM驱动的语义数据运算符提升表格机器学习流水线的预测性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05506 2026-02-06 cs.HC 75%

Relying on LLMs: Student Practices and Instructor Norms are Changing in Computer Science Education

依赖大语言模型:计算机科学教育中学生实践与教师规范正在发生变化

Xinrui Lin, Heyan Huang, Shumin Shi, John Vines

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了计算机科学教育中学生与LLMs的互动,发现学生实践与教师规范存在不同程度的冲突,并提出了LLMs设计指南以促进学习。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03531 2026-02-06 cs.CL cs.AI cs.LG 75%

Real-Time Detection of Hallucinated Entities in Long-Form Generation

长文本生成中hallucinated实体的实时检测

Oscar Obeso, Andy Arditi, Javier Ferrando, Joshua Freeman, Cameron Holmes, Neel Nanda

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种廉价且可扩展的方法,用于实时检测长文本生成中的幻觉实体,通过网络搜索标注数据集训练高效分类器,并在多个模型家族上实现了优于基线的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05628 2026-02-06 cs.HC cs.AI cs.CL 73%

AI chatbots versus human healthcare professionals: a systematic review and meta-analysis of empathy in patient care

人工智能聊天机器人与人类医疗专业人员:关于患者护理中同理心的系统综述和荟萃分析

Alastair Howcroft, Amber Bennett-Weston, Ahmad Khan, Joseff Griffiths, Simon Gay, Jeremy Howick

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过系统综述和荟萃分析,发现AI聊天机器人在文本场景中普遍被感知为比人类医疗专业人员更具同理心。

Comments Open Access Invited Review. Systematic review and meta analysis of 15 studies 2023-2024. Published 20 October 2025

Journal ref British Medical Bulletin, Volume 156, Issue 1, December 2025, ldaf017

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16175 2026-02-06 cs.LG cs.AI 73%

Learning to Discover at Test Time

在测试时间学习以发现

Mert Yuksekgonul, Daniel Koceja, Xinhao Li, Federico Bianchi, Jed McCaleb, Xiaolong Wang, Jan Kautz, Yejin Choi, James Zou, Carlos Guestrin, Yu Sun

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达) Astera Institute(Astera研究院) UC San Diego(加州大学圣地亚哥分校) Together AI

专题命中 领域大模型 :LLM(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 通过在测试时间进行强化学习,TTT-Discover方法在多个科学领域实现了新的前沿状态,利用开放模型和公开代码实现高效解决方案。

Comments Code: https://github.com/test-time-training/discover

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05930 2026-02-06 cs.DL cs.AI 70%

Compound Deception in Elite Peer Review: A Failure Mode Taxonomy of 100 Fabricated Citations at NeurIPS 2025

精英同行评审中的复合欺骗:100个2025年NeurIPS伪造引用的失败模式分类

Samar Ansari

机构 * School of Computing and Engineering Sciences University of Chester(计算与工程科学学院 英国切斯特大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究分析了NeurIPS 2025中100个伪造引用的失败模式,发现所有幻觉均表现出复合失败模式,揭示同行评审在验证引用时的不足,并提出强制自动引用验证的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05692 2026-02-06 cs.CL 70%

MedErrBench: A Fine-Grained Multilingual Benchmark for Medical Error Detection and Correction with Clinical Expert Annotations

MedErrBench: 一种细粒度多语言基准,用于医疗错误检测与修正,带有临床专家注释

Congbo Ma, Yichun Zhang, Yousef Al-Jazzazi, Ahamed Foisal, Laasya Sharma, Yousra Sadqi, Khaled Saleh, Jihad Mallat, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) New York University(纽约大学) University of Birmingham(伯明翰大学) Cleveland Clinic Abu Dhabi(克利夫兰医学中心阿布扎赫尔分校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MedErrBench是一个多语言医疗错误检测与修正基准,通过临床专家注释评估各类语言模型性能,揭示非英语环境中的性能差距,推动多语言临床NLP发展。

详情

展开后加载摘要…

URL PDF HTML 收藏