arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-12 至 2025-12-12 共收录 135 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 26 篇

2504.08694 2025-12-12 cs.CL 89%

TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning

TP-RAG:用于时空感知旅行规划的检索增强型大语言模型代理基准测试

Hang Ni, Fan Liu, Xinyu Ma, Lixin Su, Shuaiqiang Wang, Dawei Yin, Hui Xiong, Hao Liu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 TP-RAG提出了一种用于时空感知旅行规划的检索增强型大语言模型基准测试,通过整合参考轨迹提升旅行计划的空间效率和兴趣点合理性,采用EvoRAG框架实现更高效的时空合规性。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21051 2025-12-12 cs.CR cs.AI cs.NI 89%

Toward Intelligent and Secure Cloud: Large Language Model Empowered Proactive Defense

迈向智能和安全的云:大型语言模型赋能的主动防御

Yuyang Zhou, Guang Cheng, Kang Du, Zihan Chen, Yuyu Zhao

机构 * School of Cyber Science and Engineering, Southeast University, Purple Mountain Laboratories, and Jiangsu Province Engineering Research Center of Security for Ubiquitous Network(网络安全学院、东南大学、紫山实验室以及江苏省物联网安全工程技术研究中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出LLM-PD,一种基于大型语言模型的主动防御架构,用于有效应对云网络中的DoS攻击,通过数据分析和自我进化提升防御效率。

Comments 7 pages; Accepted by IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06392 2025-12-12 cs.LG cs.AI 88%

RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs

RLAX:在TPUs上为大语言模型实现大规模分布式强化学习

Runlong Zhou, Lefan Zhang, Shang-Chen Wu, Kelvin Zou, Hanzhi Zhou, Ke Ye, Yihao Feng, Dong Yin, Alex Guillen Garcia, Dmytro Babych, Rohit Chatterjee, Matthew Hopkins, Xiang Kong, Chang Lan, Lezhi Li, Yiping Ma, Daniele Molinari, Senyu Tong, Yanchao Sun, Thomas Voice, Jianyu Wang, Chong Wang, Simon Wang, Floris Weers, Yechen Xu, Guolin Yin, Muyang Yu, Yi Zhang, Zheng Zhou, Danyang Zhuo, Ruoming Pang, Cheng Leong

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 RLAX在TPUs上实现大规模分布式强化学习,通过参数服务器架构和新数据集筛选技术,提升大语言模型的推理能力。

Comments The submission is being withdrawn because internal stakeholders determined that it is not appropriate to publish work on this topic at this time

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10273 2025-12-12 cs.AI 88%

Reverse Thinking Enhances Missing Information Detection in Large Language Models

逆向思维增强大语言模型中缺失信息检测能力

Yuxin Liu, Chaojie Gu, Yihang Zhang, Bin Qian, Shibo He

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出逆向思维框架,通过引导LLM进行逆向推理来提升缺失信息检测的准确性与鲁棒性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10440 2025-12-12 cs.CL 83%

Enhancing Next-Generation Language Models with Knowledge Graphs: Extending Claude, Mistral IA, and GPT-4 via KG-BERT

通过知识图谱增强下一代语言模型:通过KG-BERT扩展Claude、Mistral IA和GPT-4

Nour El Houda Ben Chaabene, Hamza Hammami

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) National Engineering School of Tunis(突尼斯国家工程学院) Faculty of Sciences of Tunis(突尼斯科学学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 通过KG-BERT将知识图谱与Claude、Mistral IA和GPT-4结合,提升其事实可靠性与上下文感知能力。

Comments This paper was accepted and scheduled for inclusion in the ICALT 2025 proceedings but was ultimately not published due to absence from the conference presentation. It appears in the official program booklet. Conference: 2025 IEEE International Conference on Advanced Learning Technologies (ICALT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19942 2025-12-12 cs.LG 83%

Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning

微分平滑缓解锐化并提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Huaqing Zhang, Aditi Raghunathan

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 微分平滑通过缓解RL微调中的锐化问题,提升大语言模型的推理能力和输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10300 2025-12-12 cs.AI 79%

Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules

探讨视觉语言模型中注意力头的功能作用:推理模块的证据

Yanbei Jiang, Xueqi Ma, Shu Liu, Sarah Monazam Erfani, Tongliang Liu, James Bailey, Jey Han Lau, Krista A. Ehinger

机构 * The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文通过CogVision数据集探讨视觉语言模型中注意力头的功能作用,揭示其在多模态推理中的关键作用及分布特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07702 2025-12-12 cs.CV cs.AI 79%

Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment

引导不应生成的内容:用于文本-图像对齐的自动化负提示

Sangha Park, Eunji Kim, Yeongtak Oh, Jooyoung Choi, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Amazon(亚马逊) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(IPAI、AIIS、ASRI、INMC 和 ISRC,首尔国立大学)

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 本文提出NPC方法,通过自动化负提示生成提升文本-图像对齐效果,在GenEval++和Imagine-Bench上取得优异成绩。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10121 2025-12-12 cs.CL cs.AI cs.CY q-fin.GN 79%

Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing

流程即一切:通过高熵信息觅食和对抗性节奏控制摆脱'统计平滑陷阱

Zhongjie Jiang

机构 * Zhongjie Jiang(江宗杰)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DeepNews框架,通过高熵信息觅食和对抗性节奏控制,解决LLMs在长文本生成中的幻觉、逻辑一致性和个性化表达难题,实验显示其在金融报道中表现优异。

Comments 22 pages, 8 figures. Includes an ecological validity blind test where the Agentic Workflow achieved a 25% acceptance rate in top-tier media, decisively outperforming the SOTA Zero-shot baseline (0%). Features the DNFO-v5 ontology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10610 2025-12-12 cs.MA 78%

Thinking While Driving: A Concurrent Framework for Real-Time, LLM-Based Adaptive Routing

驾驶中思考:一种用于实时、基于大语言模型的自适应路由的并发框架

Xiaopei Tan, Muyang Fan

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 该研究提出了一种基于大语言模型的实时自适应路由框架,通过并发处理实现动态路径规划与拥堵绕行,提升交通效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19486 2025-12-12 eess.SY cs.LG cs.MA cs.SY 77%

VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture

VLMLight:通过视觉-语言元控制与双分支推理架构实现安全关键的交通信号控制

Maonan Wang, Yirong Chen, Aoyu Pang, Yuxin Cai, Chung Shue Chen, Yuheng Kan, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nokia Bell Labs(诺基亚贝尔实验室) Fourier Intelligence(Fourier智能)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 VLMLight通过视觉-语言元控制与双分支推理架构,实现安全关键的交通信号控制,显著减少紧急车辆等待时间并提升系统安全性。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15257 2025-12-12 cs.CL 77%

When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners

当语言更少时更有效:语言推理解耦使LLM成为更好的多语言推理者

Weixiang Zhao, Jiahe Guo, Yang Deng, Tongtong Wu, Wenxuan Zhang, Yulin Hu, Xingyu Sui, Yanyan Zhao, Wanxiang Che, Bing Qin, Tat-Seng Chua, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理学院) Monash University(墨尔本大学) Singapore University of Technology and Design(新加坡科技设计大学) National University of Singapore(国立新加坡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 通过解耦语言和推理能力,使LLM在多语言推理中表现更优,无需额外训练开销。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10756 2025-12-12 cs.CL cs.LG 73%

OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification

基于结果的过程验证器OPV用于高效长链式推理验证

Zijian Wu, Lingkai Kong, Wenwei Zhang, Songyang Gao, Yuzhe Gu, Zhongrui Cai, Tianyou Ma, Yuhong Liu, Zhi Wang, Runyuan Ma, Guangyu Wang, Wei Li, Conghui He, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学机器学习实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 OPV通过基于结果的过程验证方法,实现对长链式推理的高效准确验证,提升大规模注释效率并优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10561 2025-12-12 cs.CL cs.LG 73%

Causal Reasoning Favors Encoders: On The Limits of Decoder-Only Models

因果推理更青睐编码器:关于解码器-only模型极限的探讨

Amartya Roy, Elamparithy M, Kripabandhu Ghosh, Ponnurangam Kumaraguru, Adrian de Wynter

机构 * SIRE, IIT Delhi(IIT德里SIRE) Robert Bosch GmbH, India(印度罗伯特博世集团) IIIT Hyderabad(海得拉巴IIIT) IISER Kolkata(科钦IISER) Microsoft and the University of York(微软和约克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了因果推理中编码器和编码器-解码器架构相较于仅解码器模型的优势,发现前者在多跳联合推理和分布偏移鲁棒性方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09935 2025-12-12 cs.AI cs.LG 73%

Exploring Health Misinformation Detection with Multi-Agent Debate

探索多智能体辩论中的健康 misinformation 检测

Chih-Han Chen, Chen-Han Tsai, Yu-Shao Peng

机构 * National Taiwan University(台湾国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段框架,通过多智能体辩论与自动化评分结合,提升健康虚假信息检测的准确性与说服力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10702 2025-12-12 cs.AI 70%

COMPARE: Clinical Optimization with Modular Planning and Assessment via RAG-Enhanced AI-OCT: Superior Decision Support for Percutaneous Coronary Intervention Compared to ChatGPT-5 and Junior Operators

COMPARE: 通过RAG增强的AI-OCT实现临床优化:与ChatGPT-5和初级操作者相比,为经皮冠状动脉介入术提供更优的决策支持

Wei Fang, Chiyao Wang, Wenshuai Ma, Hui Liu, Jianqiang Hu, Xiaona Niu, Yi Chu, Mingming Zhang, Jingxiao Yang, Dongwei Zhang, Zelin Li, Pengyun Liu, Jiawei Zheng, Pengke Zhang, Chaoshi Qin, Wangang Guo, Bin Wang, Yugang Xue, Wei Zhang, Zikuan Wang, Rui Zhu, Yihui Cao, Quanmao Lu, Rui Meng, Yan Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CA-GPT通过RAG增强的AI-OCT系统在PCI规划和评估中优于ChatGPT-5和初级医生,提供更可靠的决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09443 2025-12-12 cs.HC cs.AI math.OC 70%

Advancing Mathematical Research via Human-AI Interactive Theorem Proving

通过人机交互定理证明推进数学研究

Chenyi Li, Zhijian Lai, Dong An, Jiang Hu, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Yau Mathematical Sciences Center, Tsinghua University(清华大学尤伊数学科学中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种人机交互的定理证明流程,利用大语言模型辅助数学研究,通过案例研究展示其在流形优化与Grover算法间连接的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04629 2025-12-12 cs.AI 70%

BioMedGPT-Mol: Multi-task Learning for Molecular Understanding and Generation

BioMedGPT-Mol: 用于分子理解和生成的多任务学习

Chenyang Zuo, Siqi Fan, Zaiqing Nie

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) PharMolix Inc.(PharMolix公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BioMedGPT-Mol通过多任务学习方法,实现了分子理解和生成任务的高效建模,并在 retrosynthetic 计划中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19286 2025-12-12 cs.CL 70%

TheMCPCompany: Creating General-purpose Agents with Task-specific Tools

TheMCPCompany:创建通用代理的专用工具

Reza Esfandiarpoor, Vishwas Suryanarayanan, Stephen H. Bach, Vishal Chowdhary, Anthony Aue

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TheMCPCompany通过评估工具调用代理在现实世界服务交互中的表现,揭示了当前模型在复杂任务中的挑战。

Comments Code: https://github.com/Reza-esfandiarpoor/the-mcp-company

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10927 2025-12-12 cs.CV 67%

FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos

FoundationMotion: 自动标注与视频中空间运动的推理

Yulu Gan, Ligeng Zhu, Dandan Shan, Baifeng Shi, Hongxu Yin, Boris Ivanovic, Song Han, Trevor Darrell, Jitendra Malik, Marco Pavone, Boyi Li

机构 * MIT(麻省理工学院) NVIDIA(英伟达) UMich(密歇根大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 FoundationMotion通过自动数据整理管道生成大规模细粒度运动数据集,提升开源模型在运动理解与空间推理任务中的性能。

Comments Code is available at https://github.com/Wolfv0/FoundationMotion/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16203 2025-12-12 cs.CV cs.AI 57%

When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models

当对齐失败时:针对视觉-语言-动作模型的多模态对抗攻击

Yuping Yan, Yuhan Xie, Yixin Zhang, Lingjuan Lyu, Handing Wang, Yaochu Jin

机构 * TGAI Lab, School of Engineering, Westlake University(西拉库大学工程学院TGAI实验室) Pennsylvania State University(宾夕法尼亚州立大学) Sony Research, Sony(索尼研究实验室,索尼) Xidian University(西安电子科技大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文提出VLA-Fool,针对视觉-语言-动作模型的多模态对抗攻击,揭示其在白盒和黑盒环境下具身多模态对齐的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13886 2025-12-12 cs.CL 57%

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Game-RL: 合成多模态可验证游戏数据以提升VLMs的通用推理能力

Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, Chaoran Tao, Zhiyuan Guo, Jizhou Yu, Tianhao Cheng, Zhiheng Xi, Changhao Jiang, Zhangyue Yin, Yining Zheng, Weifeng Ge, Guanhua Chen, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 Game-RL通过合成多模态可验证游戏数据提升VLMs的通用推理能力。

Comments 69 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10238 2025-12-12 cs.SE 50%

Studying and Automating Issue Resolution for Software Quality

研究和自动化软件质量的问题解决

Antu Saha

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本研究通过提升issue报告质量、表征开发者工作流程和自动化解决任务,推动AI驱动的issue解决,提升软件质量。

Comments 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10125 2025-12-12 econ.TH 50%

Motivated Reasoning and Information Aggregation

动机性推理与信息聚合

Avidit Acharya, Kyungtae Park, Tomer Zaidman

专题命中 推理与问题求解 :SLM(abstract)

AI总结 本文研究了动机性推理对信息聚合的影响,发现其在不同设定中对福利和信息聚合有不同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 32 篇

2511.19877 2025-12-12 cs.MM cs.CV cs.LG eess.AS 89%

It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models

它能听,也能看 too:通过将视觉理解整合到音频语言模型中构建多模态大语言模型以检测抑郁症

Xiangyu Zhao, Yaling Shen, Yiwen Jiang, Zimu Wang, Jiahe Liu, Maxmartwell H Cheng, Guilherme C Oliveira, Robert Desimone, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Massachusetts Institute of Technology(麻省理工学院) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出了一种多模态大语言模型框架,通过整合视觉理解到音频语言模型中,提升抑郁症检测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19999 2025-12-12 cs.CL 88%

The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Models

SIFo基准:研究大型语言模型的顺序指令遵循能力

Xinyi Chen, Baohao Liao, Jirui Qi, Panagiotis Eustratiadis, Christof Monz, Arianna Bisazza, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SIFo基准通过四个任务评估大型语言模型在多指令遵循中的能力,发现较新和更大的模型在任务表现上更优,揭示了当前语言模型在指令序列处理上的鲁棒性不足。

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11255 2025-12-12 cs.HC 88%

Visualization Generation with Large Language Models: An Evaluation

利用大语言模型进行可视化生成:一项评估

Xinyu Wang, Chenwei Liang, Shunyuan Zheng, Jinyuan Liang, Guozheng Li, Yu Zhang, Chi Harold Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了不同大语言模型在NL2VIS任务中生成可视化规范的能力,发现提示策略、图表类型和模型间存在显著性能差异,并提出改进基准的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10791 2025-12-12 cs.CL cs.AI 87%

The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality

FACTS排行榜:大型语言模型事实性的综合基准

Aileen Cheng, Alon Jacovi, Amir Globerson, Ben Golan, Charles Kwong, Chris Alberti, Connie Tao, Eyal Ben-David, Gaurav Singh Tomar, Lukas Haas, Yonatan Bitton, Adam Bloniarz, Aijun Bai, Andrew Wang, Anfal Siddiqui, Arturo Bajuelos Castillo, Aviel Atias, Chang Liu, Corey Fry, Daniel Balle, Deepanway Ghosal, Doron Kukliansky, Dror Marcus, Elena Gribovskaya, Eran Ofek, Honglei Zhuang, Itay Laish, Jan Ackermann, Lily Wang, Meg Risdal, Megan Barnes, Michael Fink, Mohamed Amin, Moran Ambar, Natan Potikha, Nikita Gupta, Nitzan Katz, Noam Velan, Ofir Roval, Ori Ram, Polina Zablotskaia, Prathamesh Bang, Priyanka Agrawal, Rakesh Ghiya, Sanjay Ganapathy, Simon Baumgartner, Sofia Erell, Sushant Prakash, Thibault Sellam, Vikram Rao, Xuanhui Wang, Yaroslav Akulov, Yulong Yang, Zhen Yang, Zhixin Lai, Zhongru Wu, Anca Dragan, Avinatan Hassidim, Fernando Pereira, Slav Petrov, Srinivasan Venkatachary, Tulsee Doshi, Yossi Matias, Sasha Goldshtein, Dipanjan Das

机构 * Google(谷歌)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 FACTS排行榜为大型语言模型提供事实性评估的综合基准,通过四个子排行榜全面衡量模型在不同场景下的事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10262 2025-12-12 cs.CV 86%

VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models

基于视觉大语言模型的新型类别发现

Yuetong Su, Baoguo Wei, Xinyu Wang, Xu Li, Lixin Li

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 基于视觉大语言模型的新型类别发现方法,通过融合视觉-文本语义和原型引导聚类,提升未知类别分类准确率25.3%,并展现对长尾分布的鲁棒性。

Comments 8 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03859 2025-12-12 cs.CL 85%

Anthropocentric bias in language model evaluation

语言模型评估中的人本偏见

Raphaël Millière, Charles Rathkopf

机构 * University of Oxford(牛津大学) Forschungszentrum Jülich(尤利希研究中心)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文指出语言模型评估中存在人本偏见,提出通过结合行为实验与机制研究来减少这些偏见,以更准确评估模型能力。

Comments Published in Computational Linguistics

Journal ref Computational Linguistics, 1-10. (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏