arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 455 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 103 篇

2505.20162 2026-02-10 cs.AI cs.CL cs.CR cs.LG 87%

Capability-Based Scaling Trends for LLM-Based Red-Teaming

基于能力的LLM红队测试规模趋势

Alexander Panfilov, Paul Kassianik, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Foundation AI – Cisco Systems Inc.(AI基础研究机构——思科系统公司) EPFL(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析攻击者与目标模型能力差距,揭示了红队测试中攻击成功率随模型能力变化的趋势,提出jailbreaking scaling曲线以预测攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08003 2026-02-10 cs.LG cs.AI cs.DC cs.IT math.IT stat.ML 86%

Don't Always Pick the Highest-Performing Model: An Information Theoretic View of LLM Ensemble Selection

不要总是选择表现最好的模型:对大语言模型集成选择的信息论视角

Yigit Turkmen, Baturalp Buyukates, Melih Bastopcu

机构 * Department of Electrical and Electronics Engineering, Bilkent University, Ankara, Turkey(电气与电子工程系,比尔肯大学,安卡拉,土耳其) School of Computer Science, University of Birmingham, Birmingham, UK(计算机科学学院,伯明翰大学,伯明翰,英国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于信息论的集成选择算法,通过最大化互信息来选择模型,以提高集成性能并避免性能饱和问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08896 2026-02-10 cs.IR cs.AI 85%

OmniReview: A Large-scale Benchmark and LLM-enhanced Framework for Realistic Reviewer Recommendation

OmniReview: 一个大规模基准和基于LLM的框架,用于现实中的审稿人推荐

Yehua Huang, Penglei Sun, Zebin Chen, Zhenheng Tang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OmniReview提出了一种基于LLM和多任务学习的框架,通过整合多源数据构建大规模基准,实现更精确的审稿人推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08253 2026-02-10 cs.AI 85%

G-LNS: Generative Large Neighborhood Search for LLM-Based Automatic Heuristic Design

G-LNS:基于生成式大邻域搜索的LLM自动启发式设计

Baoyun Zhao, He Wang, Liang Zeng

机构 * Software College, Northeastern University(东北大学软件学院) International Centre for Theoretical Physics Asia-Pacific, University of Chinese Academy of Sciences(中国科学院大学国际理论物理亚太中心) Taiji Laboratory for Gravitational Wave Universe, University of Chinese Academy of Sciences(中国科学院大学太极引力波宇宙实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 G-LNS通过生成式进化框架,结合LLM共同进化破坏与修复操作符,实现了大邻域搜索操作符的自动化设计,在复杂组合优化问题中表现出更强的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05842 2026-02-10 cs.CL 85%

Reinforcement World Model Learning for LLM-based Agents

基于强化学习的世界模型学习用于基于大语言模型的智能体

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath, Nikhil Singh, Jiangfeng Gao, Zhou Yu

机构 * Columbia University, New York(哥伦比亚大学) Microsoft Research, Redmond(微软研究院) Dartmouth College, Hanover(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于强化学习的世界模型学习方法,用于提升基于大语言模型的智能体在环境动态适应和预测方面的性能。

Comments fixed Nikhil Singh's affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22896 2026-02-10 cs.AI 85%

Game-Theoretic Co-Evolution for LLM-Based Heuristic Discovery

基于博弈论的LLM启发式发现共演化

Xinyi Ke, Kai Li, Junliang Xing, Yifan Zhang, Jian Cheng

机构 * C2DL, Institute of Automation, Chinese Academy of Sciences(C2DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASRO框架,通过博弈论方法实现求解器与实例生成器的共演化,提升启发式发现的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07996 2026-02-10 cs.CL 85%

The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation

从不承认的裁判:基于大语言模型的评估中的隐藏捷径

Arash Marioriyad, Omid Ghahroodi, Ehsaneddin Asgari, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(沙菲大学技术学院) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示了基于大语言模型的评估中隐藏的捷径问题,指出裁判模型在面对注入提示时缺乏透明度,导致裁决偏移率高但提示识别率低,揭示了评估流程中的可靠性缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07673 2026-02-10 cs.CL 85%

Blind to the Human Touch: Overlap Bias in LLM-Based Summary Evaluation

无人类触感:基于LLM的摘要评估中的重叠偏差

Jiangnan Fang, Cheng-Tse Liu, Hanieh Deilamsalehy, Nesreen K. Ahmed, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究发现LLM在摘要评估中对重叠度敏感,随着重叠减少,LLM更倾向于选择其他LLM生成的摘要,表明需采用更复杂的评判技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07733 2026-02-10 cs.AI 85%

SurveyG: A Multi-Agent LLM Framework with Hierarchical Citation Graph for Automated Survey Generation

SurveyG: 一种基于分层引用图的多智能体LLM框架用于自动化综述生成

Minh-Anh Nguye, Minh-Duc Nguyen, Ha Lan N. T., Kieu Hai Dang, Nguyen Tien Dong, Dung D. Le

机构 * CMC OpenAI, VinUniversity(CMC OpenAI与 VinUniversity) VinUniversity

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SurveyG通过分层引用图和多智能体验证生成结构化的综述,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17834 2026-02-10 cs.CV 85%

Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography

从多模态数据集构建通用基础模型用于三维计算机断层扫描

Ibrahim Ethem Hamamci, Sezgin Er, Chenyu Wang, Furkan Almas, Ayse Gulnihan Simsek, Sevval Nil Esirgun, Irem Dogan, Omer Faruk Durugol, Benjamin Hou, Suprosanna Shit, Weicheng Dai, Murong Xu, Hadrien Reynaud, Muhammed Furkan Dasdelen, Bastian Wittmann, Tamaz Amiranashvili, Enis Simsar, Mehmet Simsar, Emine Bensu Erdemir, Abdullah Alanbay, Anjany Sekuboyina, Berkan Lafci, Ahmet Kaplan, Zhiyong Lu, Malgorzata Polacin, Bernhard Kainz, Christian Bluethgen, Kayhan Batmanghelich, Mehmet Kemal Ozdemir, Bjoern Menze

机构 * Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) International School of Medicine, Istanbul Medipol University(伊斯坦布尔梅迪波尔大学国际医学院) Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Division of Intramural Research, National Institutes of Health(美国国立卫生研究院内部研究部) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Institute for Diagnostic and Interventional Radiology, University Hospital Zurich(苏黎世大学医院诊断与介入放射学研究所) Department Artificial Intelligence in Biomedical Engineering, FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡工业大学生物医学工程人工智能系)

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出CT-RATE数据集及CT-CLIP和CT-CHAT模型,用于三维医学影像的通用基础模型研究,提升了多异常检测和病例检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06998 2026-02-10 cs.CY 85%

Tokenizations for Austronesian Language Models: study on languages in Indonesia Archipelago

印尼群岛语言模型的分词:对印尼群岛地区语言的研究

Andhika Bernard Lumbantobing, Hokky Situngkir

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本研究提出基于音节的分词方法,用于印尼群岛地区语言,通过音节分割和传统印尼文字原则,提升多语言LLM的语音和形态模式保留能力。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03152 2026-02-10 cs.CL cs.AI cs.LG 85%

MedVAL: Toward Expert-Level Medical Text Validation with Language Models

MedVAL: 向语言模型的专家级医学文本验证迈进

Asad Aali, Vasiliki Bikia, Maya Varma, Nicole Chiou, Sophie Ostmeier, Arnav Singhvi, Magdalini Paschali, Ashwin Kumar, Andrew Johnston, Karimar Amador-Martinez, Eduardo Juan Perez Guerrero, Paola Naovi Cruz Rivera, Sergios Gatidis, Christian Bluethgen, Eduardo Pontes Reis, Eddy D. Zandee van Rilland, Poonam Laxmappa Hosamani, Kevin R Keet, Minjoung Go, Evelyn Ling, David B. Larson, Curtis Langlotz, Roxana Daneshjou, Jason Hom, Sanmi Koyejo, Emily Alsentzer, Akshay S. Chaudhari

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MedVAL通过自监督蒸馏方法,利用合成数据提升语言模型在医学文本验证中的性能,达到专家级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08229 2026-02-10 cs.AI cs.CR cs.LG 84%

InfiCoEvalChain: A Blockchain-Based Decentralized Framework for Collaborative LLM Evaluation

InfiCoEvalChain: 一种基于区块链的去中心化框架用于协作大语言模型评估

Yifan Yang, Jinjia Li, Kunxi Li, Puhao Zheng, Yuanyi Wang, Zheyan Qu, Yang Yu, Jianmin Wu, Ming Li, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 InfiCoEvalChain提出一种基于区块链的去中心化框架,通过大规模基准测试和集体验证,提升大语言模型评估的稳定性和代表性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06914 2026-02-10 cs.CR cs.AI 83%

SoK: Trust-Authorization Mismatch in LLM Agent Interactions

SoK:LLM代理交互中的信任-授权不匹配

Guanquan Shi, Haohua Du, Zhiqiang Wang, Xiaoyu Liang, Weiwenpei Liu, Song Bian, Zhenyu Guan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过B-I-P框架系统分析LLM代理交互中的信任-授权不匹配问题,揭示了动态信任与静态授权之间的脱节,并提出动态风险适应性授权的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07993 2026-02-10 cs.CV cs.AI 83%

MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance

MCIE: 多模态大语言模型驱动的复杂指令图像编辑与空间引导

Xuehai Bai, Xiaoling Gu, Akide Liu, Hangjie Yuan, YiFan Zhang, Jack Ma

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCIE通过空间引导和背景一致性模块,提升复杂指令图像编辑的指令合规性,实现23.96%的性能提升。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26553 2026-02-10 cs.CL cs.PL 83%

Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling

迈向可靠的基准测试:一种无污染、可控的多步骤LLM功能调用评估框架

Seiji Maekawa, Jackson Hassell, Pouya Pezeshkpour, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 评测与基准 :LLM(title);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出FuncBenchGen框架,通过生成多步骤工具使用任务评估LLM功能调用能力,发现依赖深度增加导致性能下降,引入重申变量值策略提升模型表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08529 2026-02-10 cs.CL cs.AI 82%

CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards

CoMAS: 通过交互奖励实现协同进化多智能体系统

Xiangyuan Xue, Yifan Zhou, Guibin Zhang, Zaibin Zhang, Yijiang Li, Chen Zhang, Zhenfei Yin, Philip Torr, Wanli Ouyang, Lei Bai

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 CoMAS通过交互奖励实现智能体的自主进化,优于未训练智能体并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24015 2026-02-10 cs.SE 82%

Hierarchical Knowledge Injection for Improving LLM-based Program Repair

分层知识注入以提高基于LLM的程序修复

Ramtin Ehsani, Esteban Parra, Sonia Haiduc, Preetha Chatterjee

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 本文提出分层知识注入框架,通过逐步提供结构化上下文提高LLM在程序修复中的表现,实现79%的修复率,展示不同bug类型对上下文层次的需求差异。

Comments Accepted at IEEE/ACM Automated Software Engineering (ASE) 2025 Conference

Journal ref Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE), 2025, pp. 1440-1452

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07055 2026-02-10 cs.AI cs.CL cs.LG 82%

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

空间理论:基础模型能否通过主动探索构建空间信念?

Pingyue Zhang, Zihan Huang, Yue Wang, Jieyu Zhang, Letian Xue, Zihan Wang, Qineng Wang, Keshigeyan Chandrasegaran, Ruohan Zhang, Yejin Choi, Ranjay Krishna, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出空间理论,探讨基础模型通过主动探索构建空间信念的挑战,发现主动-被动差距、探索低效和信念惯性等问题。

Comments published at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01392 2026-02-10 cs.CL cs.AI cs.CV 81%

ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems

ComfyBench:在ComfyUI中基于LLM的代理自主设计协作AI系统的基准测试

Xiangyuan Xue, Zeyu Lu, Di Huang, Zidong Wang, Wanli Ouyang, Lei Bai

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 ComfyBench通过评估基于LLM的代理在ComfyUI中自主设计协作AI系统的能力,提出ComfyAgent框架,展示其在任务解决中的性能与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08457 2026-02-10 cs.IR 80%

Hybrid Pooling with LLMs via Relevance Context Learning

通过相关性上下文学习实现基于LLM的混合池化

David Otero, Javier Parapar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出通过相关性上下文学习方法,利用人类判断生成显式相关性叙述,提升LLM在信息检索数据集构建中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08675 2026-02-10 cs.NI cs.AI 79%

6G-Bench: An Open Benchmark for Semantic Communication and Network-Level Reasoning with Foundation Models in AI-Native 6G Networks

6G-Bench:面向AI原生6G网络的语义通信与网络级推理开放基准

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿拉伯联合酋长国大学) G Research Center (6GRC), Khalifa University, UAE(6G研究中心(6GRC),哈利法大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 6G-Bench通过开放基准评估AI原生6G网络中的语义通信与网络级推理能力,涵盖22种基础模型,揭示了不同模型在语义推理上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08311 2026-02-10 cs.AI 79%

Moral Sycophancy in Vision Language Models

视觉语言模型中的道德趋炎奉承

Shadman Rabby, Md. Hefzul Hossain Papon, Sabbir Ahmed, Nokimul Hasan Arif, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * University of Dhaka(达卡大学) Daffodil International University(达福迪国际大学) Islamic University of Technology(伊斯兰技术大学) University of Central Florida(佛罗里达中央大学) King Fahad University of Petroleum and Minerals(国王法赫德石油与矿物大学) SDAIA - KFUPM Joint research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在道德决策中的趋炎奉承现象,发现模型在用户偏见下易产生道德错误回应,揭示了模型在伦理一致性与稳健性上的权衡问题。

Comments 13 pages, 6 figures, 8 tables, Submitted for review in ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25682 2026-02-10 cs.CL 79%

PairUni: Pairwise Training for Unified Multimodal Language Models

PairUni: 用于统一多模态语言模型的成对训练

Jiani Zheng, Zhiyang Teng, Kunpeng Qiu, Xiangtai Li, Anran Wang, Yu Tian, Ye Tian, Haochen Wang, Zhuochen Wang

机构 * ByteDance(字节跳动)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。

Comments 22 pages, 11 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18851 2026-02-10 cs.CR cs.AI 79%

Marking Code Without Breaking It: Code Watermarking for Detecting LLM-Generated Code

无需破坏代码的标记:用于检测大语言模型生成代码的代码水印

Jungin Kim, Shinwoo Park, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 STONE通过语法感知方法在非语法标记中嵌入水印,保持代码完整性并提升大语言模型生成代码的可检测性。

Comments Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07059 2026-02-10 cs.NE cs.AI cs.SE 79%

Assessing Reproducibility in Evolutionary Computation: A Case Study using Human- and LLM-based Assessment

评估进化计算中的可重复性:通过人类和LLM基于的评估进行案例研究

Francesca Da Ros, Tarik Začiragić, Aske Plaat, Thomas Bäck, Niki van Stein

机构 * DPIA, University of Udine(DPIA,乌迪内大学) LIACS, Leiden University(LIACS,莱顿大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过人类和LLM评估,研究了进化计算领域论文的可重复性现状,提出RECAP系统并发现平均完整性得分较低,自动化评估与人工评估一致度较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07027 2026-02-10 cs.CV cs.LG 79%

Fair Context Learning for Evidence-Balanced Test-Time Adaptation in Vision-Language Models

公平上下文学习用于证据平衡的测试时间适应在视觉-语言模型中

Sanggeon Yun, Ryozo Masukawa, SungHeon Jeong, Wenjun Huang, Hanning Chen, Mohsen Imani

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出公平上下文学习方法,通过解决共享证据偏差来提升视觉-语言模型在测试时间适应中的鲁棒性,有效校准文本嵌入并提高适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08672 2026-02-10 cs.CL cs.LG 79%

Learning to Judge: LLMs Designing and Applying Evaluation Rubrics

学习评判:LLMs设计与应用评价量规

Clemencia Siro, Pourya Aliannejadi, Mohammad Aliannejadi

机构 * Centrum Wiskunde & Informatica (CWI)(荷兰阿姆斯特丹数学与信息学中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究LLMs能否自主设计和应用评价量规,发现其在一致性与跨模型泛化上存在差异,需联合建模人类与LLM的评估语言以提升可靠性。

Comments Accepted at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05636 2026-02-10 cs.AI cs.CL 79%

Generative Ontology: When Structured Knowledge Learns to Create

生成本体:当结构化知识学会创造

Benny Cheung

机构 * Dynamind Research(Dynamind研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 生成本体通过融合本体结构与LLM创造力,实现结构化知识生成,展示了在桌游设计中的有效性及跨领域应用潜力。

Comments 19 pages, 12 figures, 8 tables. v2: added empirical evaluation (3 studies: ablation, benchmark, reliability), expanded related work, discussion section, appendices. Code available at https://github.com/bennycheung/GameGrammarCLI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20694 2026-02-10 cs.AI astro-ph.SR cs.LG physics.space-ph 79%

Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning

用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准

Kevin Lee, Russell Spiewak, James Walsh

机构 * Frontier Development Lab(前沿发展实验室) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) Trillium Technologies Inc.(Trillium技术公司) Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。

Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar

详情

展开后加载摘要…

URL PDF HTML 收藏