arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-17 至 2026-02-17 共收录 360 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 85 篇

2602.13650 2026-02-17 cs.CV cs.AI cs.CL 81%

KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination

KorMedMCQA-V: 一种用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试

Byungjin Choi, Seongsu Bae, Sunjun Kweon, Edward Choi

机构 * Ajou University School of Medicine(阿乔大学医学院) KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 KorMedMCQA-V是一个用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试,展示了不同模型在医疗领域中的表现差异。

Comments 17 pages, 2 figures, 6 tables. (Includes appendix.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14130 2026-02-17 cs.AI cs.CL cs.LG 80%

Algebraic Quantum Intelligence: A New Framework for Reproducible Machine Creativity

代数量子智能:一种可重复的机器创造力新框架

Kazuo Yano, Jonghyeok Lee, Tae Ishitomi, Hironobu Kawaguchi, Akira Koyama, Masakuni Ota, Yuki Ota, Nobuo Sato, Keita Shimada, Sho Takematsu, Ayaka Tobinai, Satomi Tsuji, Kazunori Yanagi, Keiko Yano, Manabu Harada, Yuki Matsuda, Kazunori Matsumoto, Kenichi Matsumura, Hamae Matsuo, Yumi Miyazaki, Kotaro Murai, Tatsuya Ohshita, Marie Seki, Shun Tanoue, Tatsuki Terakado, Yuko Ichimaru, Mirei Saito, Akihiro Otsuka, Koji Ara

机构 * Happiness Planet, Ltd.(幸福星球有限公司) Hitachi, Ltd.(日立株式会社)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出代数量子智能框架,通过非交换代数结构扩展语义空间,提升机器创造力的可重复性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05430 2026-02-17 cs.CL cs.AI cs.IR cs.LG 80%

ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering

ArtistMus: 一个全球多样、以艺术家为中心的基准,用于检索增强的音乐问答

Daeyong Kwon, SeungHeon Doh, Juhan Nam

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ArtistMus提出一个全球多样、以艺术家为中心的基准,通过检索增强生成技术提升音乐问答的准确性和上下文推理能力。

Comments Accepted to LREC 2026. This work is an evolution of our earlier preprint arXiv:2507.23334

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14177 2026-02-17 cs.CV cs.AI 79%

Towards Spatial Transcriptomics-driven Pathology Foundation Models

迈向基于空间转录组的病理基础模型

Konstantin Hemker, Andrew H. Song, Cristina Almagro-Pérez, Guillaume Jaume, Sophia J. Wagner, Anurag Vaidya, Nikola Simidjievski, Mateja Jamnik, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School, Boston, MA, USA(病理学系,马萨诸塞州总医院与哈佛医学院,波士顿,马萨诸塞州,美国) Department of Computer Science & Technology, University of Cambridge, Cambridge, UK(计算机科学与技术系,剑桥大学,剑桥,英国) Cancer Program, Broad Institute of Harvard and MIT, Cambridge, MA, USA(癌症计划,哈佛与麻省理工联合学院,剑桥,马萨诸塞州,美国) Data Science Program, Dana-Farber Cancer Institute, Boston, MA, USA(数据科学计划,达纳-法伯癌症研究所,波士顿,马萨诸塞州,美国) Harvard-MIT Division of Health Sciences and Technology, Massachusetts Institute of Technology, Cambridge, MA, USA(哈佛-麻省理工健康科学与技术 division,麻省理工学院,剑桥,马萨诸塞州,美国) Télécom Paris, Institut Polytechnique de Paris, Paris, France(巴黎电信学院,巴黎理工学院,巴黎,法国) Harvard Data Science Initiative, Harvard University, Cambridge, MA, USA(哈佛大学数据科学倡议,哈佛大学,剑桥,马萨诸塞州,美国)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 SEAL通过整合局部分子信息提升病理基础模型性能,实现跨模态应用与领域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13712 2026-02-17 cs.CV cs.LG 79%

Fine-tuned Vision Language Model for Localization of Parasitic Eggs in Microscopic Images

用于微镜图像中寄生虫卵定位的微调视觉语言模型

Chan Hao Sien, Hezerul Abdul Karim, Nouar AlDahoul

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出一种微调的视觉语言模型,用于自动定位显微图像中的寄生虫卵,实验结果显示其在mIOU指标上优于其他目标检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14524 2026-02-17 cs.CV 78%

Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model

历史OCR中的错误模式:TrOCR与视觉语言模型的比较分析

Ari Vesalainen, Eetu Mäkelä, Laura Ruotsalainen, Mikko Tolonen

机构 * University of Helsinki, Department of Computer Science, Finland(赫尔辛基大学计算机科学系) University of Helsinki, Department of Digital Humanities, Finland(赫尔辛基大学数字人文系)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文比较了TrOCR与视觉语言模型在历史文本OCR中的表现,发现两者在错误模式和学术可靠性上存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13835 2026-02-17 cs.SD 78%

Audiocards: Structured Metadata Improves Audio Language Models For Sound Design

Audiocards: 结构化元数据提升音频语言模型在声音设计中的应用

Sripathi Sridhar, Prem Seetharaman, Oriol Nieto, Mark Cartwright, Justin Salamon

机构 * New Jersey Institute of Technology(新泽西理工学院) Adobe Research(Adobe研究)

专题命中 评测与基准 :language model(title,abstract)

AI总结 Audiocards通过结构化元数据提升音频语言模型在声音设计中的性能,改进文本-音频检索和描述生成。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20630 2026-02-17 eess.AS cs.MM cs.SD 78%

ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting

ISDrama: 通过多模态提示生成沉浸式空间戏剧

Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Tao Jin, Zhou Zhao

机构 * Zhejiang University, Shanghai AI Lab(浙江大学上海人工智能实验室) Zhejiang University(浙江大学)

专题命中 评测与基准 :prompting(title,abstract)

AI总结 ISDrama通过多模态提示生成沉浸式空间戏剧,首次结合多模态数据建模和戏剧语调生成。

Comments Accepted by ACM Multimedia 2025

Journal ref MM '2025: Proceedings of the 33rd ACM International Conference on Multimedia Pages 9618 - 9627

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13633 2026-02-17 cs.CV 78%

A generalizable foundation model for intraoperative understanding across surgical procedures

一种可泛化的术中理解基础模型用于不同手术程序

Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park, Jongmin Shin, Jung Yong Kim, Sehyeon An, Jinsoo Rhu, Jongman Kim, Gyu-Seong Choi, Namkee Oh, Kyu-Hwan Jung

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 ZEN是一种基于自监督多教师蒸馏框架训练的术中手术视频理解基础模型,通过大规模数据集训练实现了跨手术程序的泛化能力,优于现有手术基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14857 2026-02-17 cs.AI 77%

World Models for Policy Refinement in StarCraft II

为《星际2》政策细化设计的世界模型

Yixin Zhang, Ziyi Wang, Yiming Rong, Haoxi Wang, Jinling Jiang, Shuang Xu, Haoran Wu, Shiyu Zhou, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 StarWM为《星际2》政策细化设计的世界模型,通过预测未来观察和结构化文本表示提升策略决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13593 2026-02-17 cs.LG stat.AP stat.ML 77%

Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs

校准的预测下界:在大语言模型中时间到不安全采样的预测下界

Hen Davidov, Shai Feldman, Gilad Freidkin, Yaniv Romano

机构 * Department of Computer Science, Technion IIT(计算机科学系) Department of Statistics, University of Oxford(统计系) Department of Electrical and Computer Engineering, Technion IIT(电气与计算机工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于生存分析的校准技术,用于构建大语言模型中时间到不安全采样的预测下界,以提高安全风险评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19666 2026-02-17 cs.CL 77%

RoD-TAL: A Benchmark for Answering Questions in Romanian Driving License Exams

RoD-TAL:罗马尼亚驾照考试问答的基准测试

Andrei Vlad Man, Răzvan-Alexandru Smădu, Cristian-George Craciun, Dumitru-Clementin Cercel, Florin Pop, Mihaela-Claudia Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest, Faculty of Automatic Control and Computers(波兰技术大学布加勒斯特分校) Technical University of Munich(慕尼黑技术大学) National Institute for Research & Development in Informatics - ICI Bucharest(信息研究所-布加勒斯特) Paris 1 Panthéon-Sorbonne University(巴黎1大学) University of Bucharest(布加勒斯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 RoD-TAL是一个用于评估大型语言模型和视觉语言模型在罗马尼亚驾照法律问答中性能的多模态基准数据集,通过文本和图像问答任务验证了领域微调和推理优化对考试通过率的影响。

Comments 41 pages, 30 figures, Accepted by the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02873 2026-02-17 cs.AI 77%

It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics

想法才是关键:评估前沿大语言模型在有害话题上的说服尝试

Matthew Kowal, Jasper Timm, Jean-Francois Godbout, Thomas Costello, Antonio A. Arechar, Gordon Pennycook, David Rand, Adam Gleave, Kellin Pelrine

机构 * Université de Montréal, MILA(蒙特利尔大学,MILA) Carnegie Mellon University(卡内基梅隆大学) MIT, Center for Research and Teaching in Economics(麻省理工学院,经济研究与教学中心) Cornell University, University of Regina(康奈尔大学, Regina大学) Cornell University, MIT(康奈尔大学,麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出APE基准测试,评估前沿大语言模型在有害话题上的说服意愿,揭示模型在有害情境下尝试说服的倾向及风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13699 2026-02-17 cs.LG 77%

Attention Head Entropy of LLMs Predicts Answer Correctness

LLMs注意力头熵预测答案正确性

Sophie Ostmeier, Brian Axelrod, Maya Varma, Asad Aali, Yabin Zhang, Magdalini Paschali, Sanmi Koyejo, Curtis Langlotz, Akshay Chaudhari

机构 * Stanford University(斯坦福大学) University Hospital Zurich(苏黎世大学医院) Microsoft AI(微软人工智能)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LLMs注意力头熵预测答案正确性,通过注意力熵模式提升跨领域泛化能力,平均提升AUROC 8.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13312 2026-02-17 cs.MA cs.AI 77%

PeroMAS: A Multi-agent System of Perovskite Material Discovery

PeroMAS:钙钛矿材料发现的多智能体系统

Yishu Wang, Wei Liu, Yifan Li, Shengxiang Xu, Xujie Yuan, Ran Li, Yuyu Luo, Jia Zhu, Shimin Di, Min-Ling Zhang, Guixiang Li

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) School of Materials Science and Engineering, Southeast University, Nanjing, China(东南大学材料科学与工程学院) School of Artificial Intelligence, Sun Yat-Sen University, Zhuhai, China(中山大学人工智能学院) Information Hub, Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China(香港科技大学(广州)信息中心) School of Computer Science and Engineering, Zhejiang Normal University, Jinhua, China(浙江师范大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PeroMAS通过多智能体系统实现钙钛矿材料的多目标优化发现,提升材料发现效率并验证其在现实中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13272 2026-02-17 cs.AI cs.LG 76%

TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks

TemporalBench: 一个用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的基准

Muyan Weng, Defu Cao, Wei Yang, Yashaswi Sharma, Yan Liu

机构 * University of Southern California(美国南加州大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI、cs.LG

AI总结 TemporalBench是一个多领域基准,用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的时序推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14170 2026-02-17 eess.SP 75%

Explainable Interictal Epileptiform Discharge Detection Method Based on Scalp EEG and Retrieval-Augmented Generation

基于头皮 EEG 和检索增强生成的可解释性癫痫发作前放电检测方法

Yu Zhu, Jiayang Guo, Jun Jiang, Peipei Gu, Xin Shu, Duo Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于头皮 EEG 和检索增强生成的可解释性癫痫发作前放电检测方法,通过双编码器和对比学习提升诊断性能和临床可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13771 2026-02-17 cs.MM 75%

SRA: Semantic Relation-Aware Flowchart Question Answering

SRA: 语义关系感知的流程图问答

Xinyu Li, Bowei Zou, Yuchong Chen, Yifan Fan, Yu Hong

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SRA通过利用大型语言模型检测节点间的语义关系,提升流程图问答的推理深度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07671 2026-02-17 cs.CL cs.AI cs.IR 73%

Benchmarking Retrieval-Augmented Generation for Chemistry

基于化学领域的检索增强生成基准测试

Xianrui Zhong, Bowen Jin, Siru Ouyang, Yanzhen Shen, Qiao Jin, Yin Fang, Zhiyong Lu, Jiawei Han

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChemRAG-Bench和Toolkit,用于评估RAG在化学领域的有效性,并展示RAG在化学任务中比直接推理方法有17.4%的性能提升。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01112 2026-02-17 cs.CL 72%

EmoLoom-2B: Fast Base-Model Screening for Emotion Classification and VAD with Lexicon-Weak Supervision and KV-Off Evaluation

EmoLoom-2B:基于词典弱监督和KV-Off评估的快速基础模型筛选用于情感分类和VAD预测

Zilin Li, Weiwei Xu, Xuanbo Lu, Zheda Liu

机构 * Zheda Liu(2 刘智达)

专题命中 评测与基准 :language model(abstract,comments);small language model(abstract);分类 cs.CL

AI总结 EmoLoom-2B通过词典弱监督和KV-Off评估,快速筛选出适用于情感分类和VAD预测的基础模型。

Comments This paper presents an initial and self-contained study of a lightweight screening pipeline for emotion-aware language modeling, intended as a reproducible baseline and system-level design reference. This latest version corrects and updates certain personal information

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06641 2026-02-17 physics.ao-ph 71%

Sea ice floe segmentation in close-range optical imagery using active contour and foundation models

利用主动轮廓和基础模型进行近距光学影像中海冰浮冰分割

Giulio Passerotti, Alberto Alberello, Marcello Vichi, Luke G. Bennetts, James Bailey, Alessandro Toffoli

专题命中 评测与基准 :foundation model(title)

AI总结 本文提出利用SAM和GVF结合的方法进行海冰浮冰分割,通过近距影像数据集评估,SAM在准确性和效率上表现最佳,而混合方法更适用于需要精确边界定义的场景。

Journal ref Earth and Space Science. 13 (2026) e2025EA004453

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14675 2026-02-17 cs.CL 70%

Crowdsourcing Piedmontese to Test LLMs on Non-Standard Orthography

众包皮埃蒙特语以测试LLM在非标准正写法上的表现

Gianluca Vico, Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查理大学数学与物理学院形式与应用语言学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过众包皮埃蒙特语数据集测试LLM在非标准正写法上的表现,发现分词惩罚但分类性能接近主流语言,翻译结果存在不对称性。

Comments 17 pages, 6 figures, at VarDial20226

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14017 2026-02-17 cs.LG 70%

S2SServiceBench: A Multimodal Benchmark for Last-Mile S2S Climate Services

S2SServiceBench:一个多模态基准用于最后一公里S2S气候服务

Chenyue Li, Wen Deng, Zhuotao Sun, Mengxi Jin, Hanzhe Cui, Han Li, Shentong Li, Man Kit Yu, Ming Long Lai, Yuhao Yang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University of Information Science and Technology(南京信息工程大学) Beijing Normal University(北京师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 S2SServiceBench是一个多模态基准,用于评估S2S气候服务中最后一公里的可靠性,通过10种服务产品和1000多个评估项目,揭示了多模态大语言模型在不确定性下的决策推理挑战。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13832 2026-02-17 cs.CL 70%

Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind

超越词语:通过心灵理论评估和弥合用户代理交互中的认知分歧

Minyuan Ruan, Ziyue Wang, Kaiming Liu, Yunghwei Lai, Peng Li, Yang Liu

机构 * Dept. of Comp. Sci. \& Tech., Institute for AI, Tsinghua University, Beijing, China Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过心灵理论评估和弥合用户代理交互中的认知分歧,通过强化学习提升模型对用户心理状态的推理能力,从而增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12991 2026-02-17 cs.HC cs.CL 70%

RAGExplorer: A Visual Analytics System for the Comparative Diagnosis of RAG Systems

RAGExplorer: 一种用于RAG系统比较诊断的可视化分析系统

Haoyu Tian, Yingchaojie Feng, Zhen Wen, Haoxuan Li, Minfeng Zhu, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) School of Computing, National University of Singapore(computing学院,新加坡国立大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RAGExplorer是一种用于RAG系统比较诊断的可视化分析系统,通过宏观到微观的工作流程帮助开发者理解性能权衡并优化设计。

Comments 11 pages, 7 figures. Accepted to IEEE TVCG (PacificVis 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01144 2026-02-17 cs.CR cs.AI 70%

AthenaBench: A Dynamic Benchmark for Evaluating LLMs in Cyber Threat Intelligence

AthenaBench: 一个用于评估LLM在网络安全威胁情报中动态基准

Md Tanvirul Alam, Dipkamal Bhusal, Salman Ahmad, Nidhi Rastogi, Peter Worth

机构 * Rochester Institute of Technology(罗切斯特技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AthenaBench通过改进的数据集和评估指标,评估了LLM在网络安全威胁情报中的表现,揭示了当前LLM在推理任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13246 2026-02-17 cs.CY cs.AI 70%

Global AI Bias Audit for Technical Governance

全球人工智能偏见审计用于技术治理

Jason Hung

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过全球人工智能数据集对Llama-3 8B模型进行压力测试,揭示了全球南北在人工智能技术知识和信息获取上的显著差距,呼吁更包容的数据表示以促进全球AI治理。

Comments 16 pages, 5 graphs, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00628 2026-02-17 cs.LG cs.AI cs.CL 67%

From Associations to Activations: Comparing Behavioral and Hidden-State Semantic Geometry in LLMs

从关联到激活:在大语言模型中比较行为与隐藏状态语义几何

Louis Schiekiera, Max Zimmer, Christophe Roux, Sebastian Pokutta, Fritz Günther

机构 * Computational Modelling Lab, Humboldt-Universität zu Berlin, Berlin, Germany(洪堡-柏林大学计算建模实验室) Department of Education and Psychology, Freie Universität Berlin, Berlin, Germany(柏林自由大学教育与心理学系) Department for AI in Society, Science, and Technology, Zuse Institute Berlin, Germany(柏林祖克研究所人工智能与社会、科学与技术部门) Institute of Mathematics, Technische Universitat Berlin, Germany(柏林技术大学数学研究所)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究比较了大语言模型中行为与隐藏状态的语义几何,发现强制选择行为能更准确地反映隐藏状态几何,且行为数据能预测未见隐藏状态相似性。

Comments 25 pages including references, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13987 2026-02-17 cs.SE 67%

ATTest: Agent-Driven Tensor Testing for Deep Learning Library Modules

基于代理的张量测试:用于深度学习库模块的单元测试生成

Zhengyu Zhan, Ye Shang, Jiawei Liu, Chunrong Fang, Quanjun Zhang, Zhenyu Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ATTest通过基于代理的框架生成深度学习库模块的高效单元测试,显著提升测试覆盖率和稳定性。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02158 2026-02-17 cs.CL cs.AI cs.LG physics.geo-ph 67%

FormationEval, an open multiple-choice benchmark for petroleum geoscience

FormationEval,一个用于石油地球科学的开源多选题基准测试

Almaz Ermilov

机构 * UiT The Arctic University of Norway(UiT北极大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FormationEval是一个开源多选题基准测试,用于评估语言模型在石油地球科学领域的表现,涵盖七个领域,包含505个问题,展示了不同模型的准确率及领域差异。

Comments v2: expanded related work, added validation details, difficulty-domain table, community feedback website (at https://www.formationeval.no). 28 pages, 8 figures, 11 tables. Benchmark and code at https://github.com/AlmazErmilov/FormationEval-an-Open-Benchmark-for-Oil-Gas-Geoscience-MCQ-Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏