arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-17 至 2026-02-17 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 85 篇

2602.14564 2026-02-17 cs.CL 92%

Assessing Large Language Models for Medical QA: Zero-Shot and LLM-as-a-Judge Evaluation

评估大型语言模型用于医疗问答:零样本和LLM作为评判者评估

Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Tareque Mohmud Chowdhury

机构 * Department of Computer Science and Engineering, Islamic University of Technology, Gazipur, Bangladesh(计算机科学与工程系,伊斯兰技术大学,加兹ipur,孟加拉国) Department of Computer Science(计算机科学系) Engineering, Islamic University of Technology, Gazipur, Bangladesh(工程,伊斯兰技术大学,加兹ipur,孟加拉国)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了多种大型语言模型在医疗问答任务中的性能,发现大模型表现更优,同时指出在实际部署中需权衡效率与避让问题。

Comments Accepted in 28th ICCIT, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09980 2026-02-17 cs.CV cs.RO 91%

V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models

V2V-LLM:基于多模态大语言模型的车与车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Stephen F. Smith, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出基于多模态大语言模型的V2V-LLM,通过车与车协同感知提升自动驾驶安全性和性能。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vllm.github.io/ Code: https://github.com/eddyhkchiu/V2V-LLM Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00232 2026-02-17 cs.CL cs.AI cs.CY cs.LG 91%

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

BiasFreeBench: 一个用于减轻大型语言模型响应偏见的基准测试

Xin Xu, Xunzhi He, Churan Zhi, Ruizhe Chen, Julian McAuley, Zexue He

机构 * UC San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 BiasFreeBench通过统一测试平台评估八种主流偏见缓解方法,提供响应层面的偏见自由分数,旨在提升大型语言模型的公平性和安全性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14743 2026-02-17 cs.CL cs.LG 91%

LLMStructBench: Benchmarking Large Language Model Structured Data Extraction

LLMStructBench: 评估大型语言模型结构化数据提取的基准测试

Sönke Tenckhoff, Mario Koddenbrock, Erik Rodner

机构 * University of Applied Sciences Berlin(柏林应用技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 LLMStructBench通过评估模型大小和提示策略对结构化数据提取的影响,为大型语言模型的解析可靠性提供新的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13540 2026-02-17 cs.CL cs.AI cs.LG 90%

On Calibration of Large Language Models: From Response To Capability

对大型语言模型的校准:从响应到能力

Sin-Han Yang, Cheng-Kuang Wu, Chieh-Yen Lin, Yun-Nung Chen, Hung-yi Lee, Shao-Hua Sun

机构 * Appier AI Research(Appier人工智能研究院) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出能力校准方法,用于改进大型语言模型在查询上的准确性估计,以提升预测和资源分配效果。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18776 2026-02-17 cs.CL cs.AI cs.LG 90%

AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field

AECBench: 一个用于评估大型语言模型在AEC领域知识能力的分层基准

Chen Liang, Zhaoqi Huang, Haofen Wang, Fu Chai, Chunying Yu, Huanhuan Wei, Zhengjie Liu, Yanpeng Li, Hongjun Wang, Ruifeng Luo, Xianzhong Zhao

机构 * College of Civil Engineering, Tongji University(同济大学土木工程学院) Shanghai Qi Zhi Institute(上海启智研究院) Arcplus Group East China Architectural Design & Research Institute Co., Ltd.(Arcplus集团东部建筑设计与研究研究院有限公司) College of Design and Innovation, Tongji University(同济大学设计与创新学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AECBench提出一个分层基准,评估大型语言模型在AEC领域知识能力,揭示模型在复杂推理和文档生成方面的不足。

Comments Accepted by Advanced Engineering Informatics. Code and data available at: https://github.com/ArchiAI-LAB/AECBench

Journal ref Advanced Engineering Informatics, Vol. 71, Article 104314 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12185 2026-02-17 cs.SE cs.CL cs.LG 90%

EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming

EVALOOOP:一种以自一致性为中心的大型语言模型编程鲁棒性评估框架

Sen Fang, Weiyuan Ding, Mengshi Zhang, Zihao Chen, Bowen Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 EVALOOOP通过自一致性反馈循环评估LLM在编程任务中的鲁棒性,利用ASL度量揭示模型在持续自指代转换中的语义保持能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02356 2026-02-17 cs.CR cs.AI 89%

Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark

评估大型语言模型的物理世界隐私意识:一种评估基准

Xinjie Shen, Mufei Li, Pan Li

机构 * Georgia Tech(佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 EAPrivacy评估基准揭示大型语言模型在物理世界隐私意识方面存在严重缺陷,需更稳健的物理感知对齐。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08500 2026-02-17 cs.AI 89%

Large Language Models as Oracles for Ontology Alignment

大型语言模型作为本体对齐的预言机

Sviatoslav Lushnei, Dmytro Shumskyi, Severyn Shykula, Ernesto Jimenez-Ruiz, Artur d'Avila Garcez

机构 * City St George’s, University of London, UK(伦敦大学城市圣乔治学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型作为预言机,通过验证高不确定性的对应关系子集,提升本体对齐任务的性能,在OAEI 2025中取得优异成绩。

Comments Paper accepted at the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), main conference. 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13611 2026-02-17 cs.SE cs.AI 89%

From What to How: Bridging User Requirements with Software Development Using Large Language Models

从‘是什么’到‘如何做’:利用大型语言模型弥合用户需求与软件开发之间的鸿沟

Xiao He, Ru Chen, Jialun Cao

机构 * University of Science and Technology Beijing(北京科技大学) Hong Kong University of Science and Technology(香港科学大学) University of Science(科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出DesBench基准测试,评估LLMs在软件设计相关任务中的表现,揭示LLMs在代码生成、面向对象建模及测试用例设计方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13941 2026-02-17 cs.HC 89%

Avoiding Social Judgment, Seeking Privacy: Investigating why Mothers Shift from Facebook Groups to Large Language Models

避免社会评判,寻求隐私:探究母亲为何从Facebook群组转向大型语言模型

Shayla Sharmin, Sadia Afrin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨母亲为何从Facebook群组转向LLM,发现社会评判和隐私需求驱动这一转变,LLM提供即时且安全的支持替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01055 2026-02-17 cs.LG cs.AI q-bio.BM q-bio.QM 88%

FGBench: A Dataset and Benchmark for Molecular Property Reasoning at Functional Group-Level in Large Language Models

FGBench: 一个用于大语言模型中功能基团级分子属性推理的数据集和基准

Xuan Liu, Siru Ouyang, Xianrui Zhong, Jiawei Han, Huimin Zhao

机构 * Department of Chemical and Biomolecular Engineering, University of Illinois Urbana-Champaign(化学与生物分子工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 FGBench通过构建包含功能基团级信息的数据集,提升大语言模型在分子属性推理任务中的能力。

Comments NeurIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13576 2026-02-17 cs.CR cs.AI cs.CL 88%

Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移

Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14970 2026-02-17 cs.CL 87%

Counterfactual Fairness Evaluation of LLM-Based Contact Center Agent Quality Assurance System

基于大语言模型的客服代理质量保障系统的反事实公平性评估

Kawin Mayilvaghanan, Siddhant Gupta, Ayush Kumar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了基于大语言模型的客服代理质量保障系统在公平性方面的表现,发现系统性偏见问题,指出需标准化的公平性审计流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14081 2026-02-17 cs.CL 87%

CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry

CCiV: 一个用于评估LLM生成中文词诗结构、节奏和质量的基准

Shangqing Zhao, Yupei Ren, Yuhao Zhou, Xiaopeng Bai, Man Lan

机构 * School of Computer Science and Technology, East China Normal University, China(东华师范大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China(东华师范大学教育人工智能研究所) Department of Chinese Language and Literature, East China Normal University, China(东华师范大学中文语言文学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CCiV基准通过评估LLM生成中文词诗的结构、节奏和质量,揭示了模型在生成词派变体时的挑战,并强调了需要更全面的受约束创造性生成方法。

Comments ARR 2025 May and Icassp 2026 submission. Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14043 2026-02-17 cs.SI cs.AI 86%

Beyond Static Snapshots: Dynamic Modeling and Forecasting of Group-Level Value Evolution with Large Language Models

超越静态快照:利用大语言模型进行群体层面价值演变的动态建模与预测

Qiankun Pi, Guixin Su, Jinliang Li, Mayi Xu, Xin Miao, Jiawei Jiang, Ming Zhong, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型进行群体层面价值演变的动态建模与预测方法,通过整合历史价值轨迹和事件影响,提升了社会模拟的准确性与预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13571 2026-02-17 cs.CL cs.AI 86%

LLM-Confidence Reranker: A Training-Free Approach for Enhancing Retrieval-Augmented Generation Systems

LLM-Confidence Reranker: 一种无需训练的增强检索增强生成系统的方法

Zhipeng Song, Xiangyu Kong, Xinrui Bao, Yizhi Zhou, Jiulong Jiao, Sitong Liu, Yuhang Zhou, Heng Qi

机构 * organization= School of Computer Science Technology, Dalian University of Technology , addressline= No.2 Linggong Road, Ganjingzi District , city= Dalian , postcode= 116024 , country= China organization= School of Information Engineering, Liaodong University , addressline= No.116 Linjiang Back Street, Zhenan District , city= Dandong , postcode= 118001 , country= China organization= School of Information Engineering, Dalian Ocean University , addressline= No. 2-52, Heishijiao Street, Shahekou District , city= Dalian , postcode= 116023 , country= China organization= Information Technology Center, Qinghai University , addressline= 251 Ningda Road, Chengbei District , city= Xining , postcode= 810016 , country= China organization= School of Electronic Information Engineering, Liaoning Technical University , addressline= 188 Longwan South Street, Sijiatun District , city= Huludao , postcode= 125105 , country= China organization= School of Artificial Intelligence, Tianjin Normal University , addressline= 393 Binshui West Road, Xiqing District , city= Tianjin , postcode= 300387 , country= China organization= Tencent (Dalian Northern Interactive Entertainment Technology Co., Ltd.) , addressline= 21/F, Tencent Building, No. 26 Jingxian St, Ganjingzi District , city= Dalian , postcode= 116085 , country= China

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM-Confidence Reranker通过利用LLM置信度信号,无需训练提升检索增强生成系统的排序效果,有效减少幻觉问题。

Comments Published by ESWA

Journal ref Expert Systems with Applications. (2026) 131627

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13543 2026-02-17 cs.IR cs.CL cs.LG 86%

LiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated News

LiveNewsBench: 用最新整理的新闻评估大语言模型网络搜索能力

Yunfan Zhang, Kathleen McKeown, Smaranda Muresan

机构 * Columbia University(哥伦比亚大学) Barnard College(巴纳德学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 LiveNewsBench通过最新新闻数据评估大语言模型的网络搜索能力,提供多跳搜索和推理任务,支持大规模训练数据集构建,公开排行榜和代码。

Comments An earlier version of this work was publicly available on OpenReview as an ICLR 2026 submission in September 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14438 2026-02-17 cs.RO cs.MA 86%

RoboSolver: A Multi-Agent Large Language Model Framework for Solving Robotic Arm Problems

RoboSolver: 一种基于多智能体大语言模型的机器人臂问题求解框架

Hamid Khabazi, Ali F. Meghdari, Alireza Taheri

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 RoboSolver通过多智能体框架结合LLM和VLM,实现机器人臂问题的自动求解,准确率达0.97。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01445 2026-02-17 cs.LG 85%

A Meta-Knowledge-Augmented LLM Framework for Hyperparameter Optimization in Time-Series Forecasting

一种增强元知识的LLM框架用于时间序列预测中的超参数优化

Ons Saadallah, Mátyás andó, Tamás Gábor Orosz

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LLM-AutoOpt通过结合贝叶斯优化与大型语言模型的上下文推理,提升时间序列预测中超参数优化的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11526 2026-02-17 cs.RO cs.AI 85%

Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis

自动驾驶中的基础模型:场景生成与场景分析的综述

Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。

Comments IEEE Open Journal of Intelligent Transportation Systems

Journal ref IEEE Open Journal of Intelligent Transportation Systems, 03 February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14357 2026-02-17 cs.HC cs.AI 85%

Key Considerations for Domain Expert Involvement in LLM Design and Evaluation: An Ethnographic Study

在LLM设计与评估中涉及领域专家的关键考虑因素:一项民族志研究

Annalisa Szymanski, Oghenemaro Anuyah, Toby Jia-Jun Li, Ronald A. Metoyer

机构 * University of Notre Dame(诺丁汉大学) Microsoft Corporation(微软公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过民族志研究,探讨了在LLM设计与评估中涉及领域专家的关键挑战与实践,提出强调AI素养和透明同意的未来开发框架。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13671 2026-02-17 cs.MA cs.AI 85%

MAS-on-the-Fly: Dynamic Adaptation of LLM-based Multi-Agent Systems at Test Time

MAS-on-the-Fly: 在测试时动态适应基于大语言模型的多智能体系统

Guangyi Liu, Haojun Lin, Huan Zeng, Heng Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MASFly通过动态适应机制在测试时优化多智能体系统,利用检索增强和经验引导机制提升任务适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13214 2026-02-17 cs.AI 85%

BotzoneBench: Scalable LLM Evaluation via Graded AI Anchors

BotzoneBench: 通过分级AI锚点实现可扩展的LLM评估

Lingfeng Li, Yunlong Lu, Yuefei Zhang, Jingyu Yao, Yixin Zhu, KeYuan Cheng, Yongyi Wang, Qirui Zheng, Xionghui Yang, Wenxin Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Software Engineering, South China University of Technology(华南理工大学软件学院) Department of Computer Science, Yale University(耶鲁大学计算机科学系) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BotzoneBench通过分级AI锚点实现LLM战略能力的可扩展评估,评估八个多样化游戏中的177,047个状态-动作对,揭示性能差异并识别战略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13377 2026-02-17 cs.SE 85%

A Survey of Code Review Benchmarks and Evaluation Practices in Pre-LLM and LLM Era

预大语言模型和大语言模型时代代码审查基准和评估实践的综述

Taufiqul Islam Khan, Shaowei Wang, Haoxiang Zhang, Tse-Hsun Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了预LLM和LLM时代代码审查基准和评估实践,提出多级分类法,揭示了审查任务的转变及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14002 2026-02-17 cs.CL cs.AI 84%

The Sufficiency-Conciseness Trade-off in LLM Self-Explanation from an Information Bottleneck Perspective

在信息瓶颈视角下,大型语言模型自我解释的充分性与简洁性权衡

Ali Zahedzadeh, Behnam Bahrak

机构 * Tehran Institute for Advanced Studies, Khatam University, Tehran, Iran(泰赫兰高级研究学院,卡坦大学,泰赫兰,伊朗)

专题命中 评测与基准 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从信息瓶颈视角探讨了大型语言模型自我解释中充分性与简洁性之间的权衡,通过实验表明简洁解释在保持准确性的同时能显著减少长度,但过度压缩会损害性能。

Comments LREC 2026 submission; focuses on LLM self-explanation, interpretability, and information bottleneck analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14989 2026-02-17 cs.CV cs.AI cs.LG 84%

ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery

ThermEval: 一种用于评估视觉语言模型在热成像上的性能的结构化基准

Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

机构 * Indian Institute of Technology, Gandhinagar, India(印度理工学院加尔各答分校) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 ThermEval通过结构化基准评估视觉语言模型在热成像上的性能,揭示其在温度推理和颜色映射转换上的不足,推动热视觉语言模型的发展。

Comments 8 Pages with 2 figures of main content. 2 pages of References. 10 pages of appendix with 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14024 2026-02-17 cs.LG cs.AI 84%

EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models

EIDOS:用于时间序列基础模型的潜在空间预测学习

Xinxing Zhou, Qingren Yao, Yiji Zhao, Chenghao Liu, Flora Salim, Xiaojie Yuan, Yanlong Wen, Ming Jin

机构 * Nankai University(南开大学) Eindhoven University of Technology(埃因霍温理工大学) Yunnan University(云南大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 EIDOS通过潜在空间预测学习提升时间序列基础模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13961 2026-02-17 cs.CV astro-ph.IM cs.CL 83%

MarsRetrieval: Benchmarking Vision-Language Models for Planetary-Scale Geospatial Retrieval on Mars

MarsRetrieval: 用于火星尺度地理空间检索的视觉-语言模型基准测试

Shuoyuan Wang, Yiran Wang, Hongxin Wei

机构 * Department of Statistics and Data Science(统计与数据科学系) Department of Earth and Space Sciences(地球与空间科学系)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.CL

AI总结 MarsRetrieval提出了一种用于评估视觉-语言模型在火星地理空间发现中检索能力的基准测试,强调领域特定微调对可推广发现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13639 2026-02-17 cs.AI cs.MA 83%

Guided Collaboration in Heterogeneous LLM-Based Multi-Agent Systems via Entropy-Based Understanding Assessment and Experience Retrieval

通过基于熵的理解评估和经验检索实现异构大语言模型多智能体系统的引导协作

Linlin Wang, Tianqing Zhu, Laiqiao Qin, Longxiang Gao, Wanlei Zhou

机构 * Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算能力互联网与服务计算重点实验室,山东省计算机科学基础研究中心)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于熵的理解评估和经验检索的引导协作框架,通过自适应引导和RAG机制提升异构多智能体系统的协作效果和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏