arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-03 至 2026-02-03 共收录 608 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 88 篇

2602.00528 2026-02-03 cs.AI 70%

How Far Are LLMs from Professional Poker Players? Revisiting Game-Theoretic Reasoning with Agentic Tool Use

LLMs距离专业扑克玩家还有多远?结合代理工具使用的博弈论推理再探

Minhua Lin, Enyan Dai, Hui Liu, Xianfeng Tang, Yuliang Yan, Zhenwei Dai, Jingying Zeng, Zhiwei Zhang, Fali Wang, Hongcheng Gao, Chen Luo, Xiang Zhang, Qi He, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) HKUST (GZ)(香港科技大学) Amazon(亚马逊) Tsinghua University(清华大学) Microsoft(微软公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ToolPoker框架,通过整合外部求解器和专业解释,提升LLMs在扑克博弈中的推理和游戏表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04291 2026-02-03 cs.CL 70%

Evolutionary Pre-Prompt Optimization for Mathematical Reasoning

数学推理中的进化预提示优化

Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud

机构 * Meta AI Paris France(Meta AI) TAU, INRIA LISN (CNRS \& Univ. Paris-Saclay) Orsay France INSA Rouen Normandy, University of Rouen Normandy, LITIS UR 4108 Rouen France Meta AI LISN (CNRS \& Univ. Paris-Saclay) INSA Rouen Normandy, University of Rouen Normandy, LITIS UR 4108

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出进化预提示优化方法,通过优化示例选择提升CoT预提示效果,在数学推理任务中取得显著提升。

Comments Revised and extended version. To appear in ACM Transactions on Evolutionary Learning and Optimization (TELO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00357 2026-02-03 cs.LG 70%

Planning with Language and Generative Models: Toward General Reward-Guided Wireless Network Design

基于语言和生成模型的规划:迈向通用奖励引导的无线网络设计

Chenyang Yuan, Xiaoyuan Cheng

机构 * University of Sheffield(谢菲尔德大学) University College London(伦敦大学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于统一奖励函数的扩散生成模型,用于高效解决室内无线网络接入点部署问题,通过大规模数据训练提升泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00154 2026-02-03 cs.CR cs.AI 70%

ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models

ReasoningBomb: 通过诱导病态长推理实现隐蔽的拒绝服务攻击

Xiaogeng Liu, Xinyan Wang, Yechao Zhang, Sanjay Kariyappa, Chong Xiang, Muhao Chen, G. Edward Suh, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) NVIDIA(NVIDIA公司) University of California, Davis(加州大学戴维斯分校) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReasoningBomb通过生成短自然提示诱导大型推理模型进入病态长推理,实现隐蔽的拒绝服务攻击,具有高放大率、隐蔽性和可优化性。

Comments Pre-print. Code is available at https://github.com/SaFo-Lab/ReasoningBomb

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18561 2026-02-03 cs.CV 67%

CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos

CoT-RVS:零样本链式推理视频对象分割

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Dartmouth College(达特茅斯学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 CoT-RVS通过零样本链式推理能力,实现了对视频对象的高效分割,无需训练即可处理复杂查询和在线视频流。

Comments Accepted to ICLR 2026. Project page: https://danielshkao.github.io/cot-rvs.html. Code: https://github.com/DanielSHKao/CoT-RVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01298 2026-02-03 cs.CV 67%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01983 2026-02-03 cs.AI 57%

Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning

从工具使用者到创作者的进化:通过无训练经验重用在多模态推理中

Xintian Shen, Jiawei Chen, Lihao Zheng, Hao Ma, Tao Wei, Kun Zhan

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 UCT框架通过无训练经验重用,使智能体从工具使用者转变为工具创造者,提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01527 2026-02-03 cs.HC cs.AI cs.CV 57%

Toward a Machine Bertin: Why Visualization Needs Design Principles for Machine Cognition

迈向机器伯林:为什么可视化需要为机器认知设计原则

Brian Keith-Norambuena

机构 * Department of Computing & Systems Engineering, Universidad Católica del Norte(计算与系统工程系,北卡洛斯大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文主张可视化领域需研究面向机器的视觉设计,以弥补机器认知需求与现有以人类为中心的知识库之间的差距。

Comments Preprint submitted to IEEE TVCG on February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01207 2026-02-03 cs.AI 57%

Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models

并非所有偏好都同等重要:面向推理模型的稳定性感知与梯度高效对齐

Hui Wu, Hengyi Cai, Jinman Zhao, Xinran Chen, Ziheng Li, Zhejun Zhao, Shuaiqiang Wang, Yuchen Li, Dawei Yin

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Baidu Inc.(百度公司) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.AI

AI总结 SAGE通过动态框架提升推理模型对齐的稳定性与梯度效率,通过信噪比优化和稳定性感知评分函数实现更高效的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01202 2026-02-03 cs.AI 57%

Workflow-R1: Group Sub-sequence Policy Optimization for Multi-turn Workflow Construction

Workflow-R1: 多轮工作流构建的分组子序列策略优化

Mingze Kong, Zikun Qu, Zhongquan Zhou, Pengyu Liang, Xiang Li, Zhiwei Shang, Zhi Hong, Kaiyu Huang, Zhiyong Wang, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Tongji University(同济大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 Workflow-R1通过分组子序列策略优化提升多轮工作流构建的灵活性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16286 2026-02-03 cs.AI cs.MA 57%

SemanticALLI: Caching Reasoning, Not Just Responses, in Agentic Systems

SemanticALLI: 在智能体系统中缓存推理,而非仅响应

Varun Chillara, Dylan Kline, Christopher Alvares, Evan Wooten, Huan Yang, Shlok Khetan, Cade Bauer, Tré Guillory, Tanishka Shah, Yashodhara Dhariwal, Volodymyr Pavlov, George Popstefanov

机构 * PMG

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 SemanticALLI通过分解生成过程,实现智能体系统中结构化中间表示的缓存,提升推理效率并减少LLM调用次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00425 2026-02-03 cs.CL 57%

Segment-Level Attribution for Selective Learning of Long Reasoning Traces

分段属性用于长推理轨迹的选择性学习

Siyuan Wang, Yanchen Liu, Xiang Ren

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL

AI总结 本文提出一种基于分段属性的选择性学习框架,通过量化标记对最终答案的影响,提升长推理轨迹学习的效率和准确性。

Comments Accepted to ICLR 2026. 16 pages, 5 figures. Code available at https://github.com/SiyuanWangw/SegmentSelectiveSFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00110 2026-02-03 cs.CV cs.LG 57%

Observing Health Outcomes Using Remote Sensing Imagery and Geo-Context Guided Visual Transformer

利用遥感图像和地理上下文引导的视觉变换器观察健康结果

Yu Li, Guilherme N. DeSouza, Praveen Rao, Chi-Ren Shyu

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 本文提出一种结合地理空间信息的视觉变换器模型,通过引导注意力机制提升遥感图像处理效果,有效预测疾病流行率。

Comments Submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01811 2026-02-03 cs.RO 50%

From Knowing to Doing Precisely: A General Self-Correction and Termination Framework for VLA models

从认知到精准执行:一种通用的自我校正与终止框架用于VLA模型

Wentao Zhang, Aolan Sun, Wentao Mo, Xiaoyang Qu, Yuxin Zheng, Jianzong Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出VLA-SCT框架,通过自我校正和终止机制提升VLA模型在抓取任务中的精度和鲁棒性,提高复杂环境下的执行可靠性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01081 2026-02-03 cs.CV 50%

MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization

MedAD-R1: 通过一致性强化策略优化实现可解释医学异常检测中的一致推理

Haitao Zhang, Yingying Wang, Jiaxiang Wang, Haote Xu, Hongyang Zhang, Yirong Chen, Yue Huang, Xinghao Ding

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Zhejiang Expressway Co., Ltd.(浙江高速公路有限公司) School of Science and Engineering, Chinese University of Hong Kong(香港中文大学科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :SFT(abstract)

AI总结 MedAD-R1通过一致性强化策略优化实现医学异常检测中的可解释推理,提升模型的可信度和可解释性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 116 篇

2510.19687 2026-02-03 cs.CL cs.AI cs.LG 90%

Are Large Language Models Sensitive to the Motives Behind Communication?

大型语言模型对沟通动机是否敏感?

Addison J. Wu, Ryan Liu, Kerem Oktar, Theodore R. Sumers, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) Anthropic

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了LLMs对沟通动机的敏感性,通过实验发现LLMs能以人类方式处理偏见信息,但需改进以适应更复杂的现实场景。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02440 2026-02-03 cs.CL 89%

Large Language Models for Mental Health: A Multilingual Evaluation

大语言模型在心理健康领域的应用:多语言评估

Nishat Raihan, Sadiya Sayara Chowdhury Puspo, Ana-Maria Bucur, Stevie Chancellor, Marcos Zampieri

机构 * George Mason University(乔治·马歇尔大学) Interdisciplinary School of Doctoral Studies, University of Bucharest(布加勒斯特大学跨学科博士研究学院) PRHLT Research Center, Universitat Politècnica de València(瓦伦西亚理工大学PRHLT研究中心) University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文评估了多语言环境下大语言模型在心理健康任务中的表现,发现其在部分数据集上表现优异,但翻译质量对性能有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07448 2026-02-03 cs.CL 89%

Large Language Models for Scientific Idea Generation: A Creativity-Centered Survey

用于科学思想生成的大型语言模型:以创造力为中心的综述

Fatemeh Shahhosseini, Arash Marioriyad, Ali Momen, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban, Shaghayegh Haghjooy Javanmard

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型在科学思想生成中的应用,分析了不同方法在创新性与科学合理性之间的权衡,并提出了评估框架以指导未来研究方向。

Comments 75 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01161 2026-02-03 cs.CL 89%

Beyond Training for Cultural Awareness: The Role of Dataset Linguistic Structure in Large Language Models

超越文化意识的训练:大型语言模型中数据集语言结构的作用

Reem I. Masoud, Chen Feng, Shunta Asano, Saied Alshahrani, Philip Colin Treleaven, Miguel R. D. Rodrigues

机构 * University College London(伦敦大学学院) Queen’s University Belfast(贝尔法斯特女王大学) The University of Tokyo(东京大学) University of Bisha(比沙大学) King Abdulaziz University(阿卜杜勒阿齐兹国王大学) AI Centre, University College London(伦敦大学学院人工智能中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了数据集语言结构对大型语言模型文化表现的影响,发现词汇导向的成分在不同模型中表现更稳定,而语义或多样性极端成分可能产生中性或有害效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15567 2026-02-03 cs.CR cs.SE 89%

MalCVE: Malware Detection and CVE Association Using Large Language Models

MalCVE: 使用大语言模型进行恶意软件检测与CVE关联

Eduard Andrei Cristea, Petter Molnes, Jingyue Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 MalCVE利用大语言模型检测恶意软件并关联CVE,实现高准确率的恶意软件识别和漏洞关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21877 2026-02-03 cs.NE 89%

Evolution of Benchmark: Black-Box Optimization Benchmark Design through Large Language Model

基准的演变:通过大语言模型进行黑盒优化基准设计

Chen Wang, Sijie Ma, Zeyuan Ma, Yue-Jiao Gong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出EoB,一种基于大语言模型的自动黑盒优化基准设计师,通过双目标优化提升基准的多样性和算法区分能力,适用于多维应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11708 2026-02-03 cs.SE 89%

From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation

从评估到增强:大型语言模型在零知识证明代码生成中的应用

Zhantong Xue, Pingchuan Ma, Zhaoyu Wang, Yuguang Zhou, Xiaoqin Zhang, Shuai Wang, Juergen Rahmel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02467 2026-02-03 cs.CL 88%

Indications of Belief-Guided Agency and Meta-Cognitive Monitoring in Large Language Models

信念引导的代理与元认知监控在大语言模型中的迹象

Noam Steinmetz Yalon, Ariel Goldstein, Liad Mudrik, Mor Geva

机构 * Blavatnik School of Computer Science and AI(Blavatnik计算机科学与人工智能学院) Tel Aviv University(特拉维夫大学) School of Psychological Sciences(心理学学院) Sagol School of Neuroscience(神经科学学院) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute) University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过HOT-3指标探讨大语言模型中信念引导的代理与元认知监控的存在,揭示了信念形成对行动选择的影响及模型自我监控的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 88%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00300 2026-02-03 cs.CL 88%

Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models

Faithful-Patchscopes: 理解和缓解大语言模型隐藏表示解释中的模型偏差

Xilin Gong, Shu Yang, Zehua Cao, Lynne Billard, Di Wang

机构 * University of Georgia(佐治亚大学) King Abdullah University of Science(国王阿卜杜勒-阿齐兹大学) Hong Kong Center for Construction Robotics(香港建筑机器人中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出BALOR方法,通过logit校准缓解大语言模型隐藏表示解释中的模型偏差,提升解释的忠实度和上下文信息的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01816 2026-02-03 cs.CV 88%

Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies

看见即相信?多模态大语言模型在视觉错觉和异常上的基准测试

Wenjin Hou, Wei Liu, Han Hu, Xiaoxiao Sun, Serena Yeung-Levy, Hehe Fan

机构 * Zhejiang University(浙江大学) Tencent Hunyuan Team(腾讯文言团队) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出VIA-Bench基准测试,评估多模态大语言模型在视觉错觉和异常上的性能,揭示其在复杂视觉任务中的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00011 2026-02-03 cs.IR cs.AI cs.CL 87%

Chained Prompting for Better Systematic Review Search Strategies

链式提示法提升系统综述搜索策略

Fatima Nasser, Fouad Trad, Ammar Mohanna, Ghada El-Hajj Fuleihan, Ali Chehab

机构 * Electrical and Computer Engineering(电气与计算机工程系) American University of Beirut(贝鲁特美国大学) Department of Internal Medicine(内科系)

专题命中 评测与基准 :prompting(title);large language model(abstract,comments);language model(abstract,comments);LLM(abstract)

AI总结 本文提出基于LLM的链式提示框架,用于自动化生成系统综述的高召回率搜索策略,通过分解目标、提取PICO要素等方法提升检索效果。

Comments Accepted in the 3rd International Conference on Foundation and Large Language Models (FLLM2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14151 2026-02-03 cs.LG cs.AI cs.CY cs.DB 86%

Trajectory Data Management and Mining: A Survey from Deep Learning to the LLM Era

轨迹数据管理与挖掘:从深度学习到大语言模型时代的综述

Wei Chen, Yuanshao Zhu, Yanchuan Chang, Kang Luo, Haomin Wen, Lei Li, Yanwei Yu, Qingsong Wen, Chao Chen, Kai Zheng, Yunjun Gao, Yu Zheng, Xiaofang Zhou, Yuxuan Liang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述了轨迹计算从深度学习到大语言模型的发展,探讨了轨迹数据管理与挖掘的应用及未来研究方向。

Comments Version 2 of Trajectory Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02287 2026-02-03 cs.CL 85%

Cross-Lingual Stability of LLM Judges Under Controlled Generation: Evidence from Finno-Ugric Languages

跨语言稳定性研究:在受控生成条件下LLM评判者的稳定性证据:基于芬兰-乌戈里语系语言

Isaac Chung, Linda Freienthal

机构 * Zendesk

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示了在受控生成条件下,LLM评判者在不同芬兰-乌戈里语系语言中的稳定性问题,发现语用判断存在排名不稳定性,需针对特定语言进行校准。

Comments First Workshop on Multilingual Multicultural Evaluation, co-located with EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21448 2026-02-03 cs.AI cs.AR 85%

ChipBench: A Next-Step Benchmark for Evaluating LLM Performance in AI-Aided Chip Design

ChipBench: 用于评估LLM在人工智能辅助芯片设计中的性能的下一步基准

Zhongkai Yu, Chenyang Zhou, Yichen Lin, Hejia Zhang, Haotian Ye, Junxia Cui, Zaifeng Pan, Jishen Zhao, Yufei Ding

机构 * University of California San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChipBench提出了一项全面的基准测试,用于评估LLM在人工智能辅助芯片设计中的性能,揭示了现有模型在关键任务上的显著性能差距,并提供自动化工具箱促进相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏