arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2512.15894 2025-12-19 cs.AI 88%

PediatricAnxietyBench: Evaluating Large Language Model Safety Under Parental Anxiety and Pressure in Pediatric Consultations

儿童焦虑基准:在儿科咨询中评估大语言模型在父母焦虑和压力下的安全性

Vahideh Zolfaghari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 PediatricAnxietyBench评估大语言模型在父母焦虑和压力下的安全性,发现70B模型在诊断和紧急情况识别方面表现更优,但所有模型均存在现实压力下的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15033 2025-12-18 cs.AI 88%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12010 2025-12-16 cs.CY cs.CL 88%

Leveraging Large Language Models for Career Mobility Analysis: A Study of Gender, Race, and Job Change Using U.S. Online Resume Profiles

利用大语言模型进行职业流动性分析:一项基于美国在线简历资料研究性别、种族和工作转换的调查

Palakorn Achananuparp, Ye Xu, Yao Lu, Xavier Jayaraj Siddarth Ashok, Ee-Peng Lim

机构 * Singapore Management University(新加坡国立管理学院) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究利用大语言模型分析美国在线简历数据,探讨性别、种族和工作转换对职业流动性的影响,发现女性和黑人毕业生的工作转换回报较低。

Comments Accepted by EPJ Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23065 2025-12-16 cs.CL 88%

SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services

SNS-Bench-VL:在社交网络服务中评估多模态大语言模型的基准测试

Hongcheng Guo, Zheyong Xie, Shaosheng Cao, Boyang Wang, Weiting Liu, Anjie Le, Lei Li, Zhoujun Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SNS-Bench-VL是一个用于评估多模态大语言模型在社交网络服务中性能的基准测试,涵盖8个多模态任务,包含4001个问题-答案对,评估25种先进模型,揭示多模态社交理解的挑战。

Comments We found problems in the code while rechecking our implementation. These issues led to noticeable numerical discrepancies, making some of the reported results and conclusions potentially unreliable. Therefore, we request to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12059 2025-12-16 cs.AI 88%

The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification

预测批评者:利用大语言模型进行差预测识别

Luke Bhan, Hanyu Zhang, Andrew Gordon Wilson, Michael W. Mahoney, Chuck Arvin

机构 * Amazon(亚马逊)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 利用大语言模型进行预测监控,通过识别不合理预测提升预测质量。

Comments Presented at AAAI 2026 AI4TS workshop and AABA4ET workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19999 2025-12-12 cs.CL 88%

The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Models

SIFo基准:研究大型语言模型的顺序指令遵循能力

Xinyi Chen, Baohao Liao, Jirui Qi, Panagiotis Eustratiadis, Christof Monz, Arianna Bisazza, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SIFo基准通过四个任务评估大型语言模型在多指令遵循中的能力,发现较新和更大的模型在任务表现上更优,揭示了当前语言模型在指令序列处理上的鲁棒性不足。

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09841 2025-12-11 cs.CL cs.CV cs.MM 88%

ChronusOmni: Improving Time Awareness of Omni Large Language Models

ChronusOmni: 提升 Omni 大语言模型的时间感知能力

Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Baichuan Inc.(百川科技公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。

Comments Code available at https://github.com/YJCX330/Chronus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08057 2025-12-10 cs.AI 88%

Large Language Models for Education and Research: An Empirical and User Survey-based Analysis

大型语言模型在教育与研究中的应用:基于实证和用户调查的分析

Md Mostafizer Rahman, Ariful Islam Shiplu, Md Faizul Ibne Amin, Yutaka Watanobe, Lu Peng

机构 * Tulane University, New Orleans, LA, USA Dhaka University of Engineering \& Technology, Gazipur, Bangladesh The University of Aizu, Aizu-Wakamatsu, Fukushima, Japan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过实证和用户调查分析,评估ChatGPT和DeepSeek在教育与研究中的表现,揭示其在语言理解、编程和专业问题解决中的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07215 2025-12-10 cs.CV cs.AI 88%

VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation

基于视觉基础模型和视觉语言模型的3D姿态估计视觉比较:VFM-VLM

Md Selim Sarowar, Sungho Kim

机构 * Dept. of Electronic Engineering Yeungnam University Advanced Visual Intelligence Lab(电子工程系 韩国又南大学 高级视觉智能实验室)

专题命中 评测与基准 :language model(title,abstract);foundation model(title,abstract);分类 cs.AI

AI总结 本文比较了基于CLIP和DINOv2的视觉模型在3D姿态估计中的性能,展示了两者在语义理解和几何精度上的互补优势,为机器人抓取应用提供了模型选择依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07075 2025-12-09 cs.CL 88%

Do Large Language Models Truly Understand Cross-cultural Differences?

大型语言模型真的能理解跨文化差异吗?

Shiwei Guo, Sihang Jiang, Qianxi He, Yanghua Xiao, Jiaqing Liang, Bi Yude, Minggui He, Shimin Tao, Li Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出SAGE基准,通过跨文化核心概念对齐和生成任务设计,评估LLMs的跨文化理解和推理能力,揭示其在跨文化推理中的系统性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03943 2025-12-04 cs.CL cs.HC 88%

Is Lying Only Sinful in Islam? Exploring Religious Bias in Multilingual Large Language Models Across Major Religions

在伊斯兰教中,说谎只是一种罪过吗?探索多语言大语言模型在主要宗教中的宗教偏见

Kazi Abrab Hossain, Jannatul Somiya Mahmud, Maria Hossain Tuli, Anik Mitra, S. M. Taiabul Haque, Farig Y. Sadeque

机构 * Computer Science and Engineering, BRAC University(布拉克大学计算机科学与工程系) Department of Computer Science and Engineering, BRAC University(布拉克大学计算机科学与工程系) Engineering, BRAC University(布拉克大学工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究通过BRAND数据集揭示多语言模型在宗教问题上的持续偏见,尤其在回答中性问题时对伊斯兰教的偏见。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02402 2025-12-03 cs.CL cs.HC 88%

TaleFrame: An Interactive Story Generation System with Fine-Grained Control and Large Language Models

TaleFrame: 一个具有细粒度控制和大型语言模型的交互式故事生成系统

Yunchao Wang, Guodao Sun, Zihang Fu, Zhehao Liu, Kaixing Du, Haidong Gao, Ronghua Liang

机构 * the College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 TaleFrame通过结合大型语言模型和人机交互技术,实现对故事生成过程的细粒度控制,提供结构化框架和直观界面,使用户能够创建、编辑并迭代优化故事内容。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01896 2025-12-02 cs.CL 88%

OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation

OPOR-Bench:评估大型语言模型在在线公共舆论报告生成中的表现

Jinzheng Yu, Yang Xu, Haozhen Li, Junqi Li, Yifan Feng, Ligu Zhu, Hao Shen, Lei Shi

机构 * Communication University of China(中国传媒大学) Harbin Institute of Technology(哈尔滨工业大学) China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司) School of Engineering, Santa Clara University(圣克拉拉大学工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 OPOR-Bench通过定义自动在线公共舆论报告生成任务,构建了包含463个危机事件的数据集,并提出OPOR-EVAL框架评估生成报告质量,为该领域研究提供基础。

Comments 27 pages, accepted by CMC-Computers, Materials & Continua, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00390 2025-12-02 cs.CL cs.IR 88%

Mitigating the Threshold Priming Effect in Large Language Model-Based Relevance Judgments via Personality Infusing

通过注入个性缓解基于大语言模型的相关性判断中的阈值先入为主效应

Nuo Chen, Hanpei Fang, Jiqun Liu, Wilson Wei, Tetsuya Sakai, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Waseda University(早稻田大学) The University of Oklahoma(俄克拉荷马大学) EureXa Labs(EureXa实验室)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文通过注入人格特征缓解基于大语言模型的相关性判断中的阈值先入为主效应,发现特定人格特征可有效降低该效应,并提出人格提示作为改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12263 2025-12-02 cs.CV cs.AI 88%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07507 2025-12-02 cs.CL 88%

Thought2Text: Text Generation from EEG Signal using Large Language Models (LLMs)

Thought2Text: 使用大型语言模型(LLMs)从EEG信号生成文本

Abhijit Mishra, Shreya Shukla, Jose Torres, Jacek Gwizdka, Shounak Roychowdhury

机构 * School of Information University of Texas at Austin(信息学院 德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 Thought2Text利用大型语言模型从EEG信号生成文本,通过多阶段微调实现脑活动的可理解表达。

Comments Accepted to Findings of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00134 2025-12-02 cs.SE cs.AI 88%

Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation

Asm2SrcEval: 评估大型语言模型在汇编到源代码翻译中的性能

Parisa Hamedi, Hamed Jelodar, Samita Bai, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity(加拿大网络安全研究所) University of New Brunswick(新不伦瑞克大学) Faculty of Computer Science(计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出Asm2SrcEval基准,评估五种先进大语言模型在汇编到源代码翻译任务中的性能,揭示模型在文本相似性、流畅性和效率上的权衡,为程序翻译的准确性和效率研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06284 2025-12-02 cs.AI 88%

A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks

多模态大语言模型在视觉-语言任务中的综合综述与指南

Chia Xin Liang, Pu Tian, Caitlyn Heqi Yin, Yao Yua, Wei An-Hou, Li Ming, Xinyuan Song, Tianyang Wang, Ziqian Bi, Ming Liu

机构 * JTB Technology Corp.(JTB技术公司) Stockton University(斯托顿大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AppCubic USA(AppCubic美国公司) Nomad Sustaintech LTD(Nomad可持续科技有限公司) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) University of Liverpool(利物浦大学) Indiana University(印第安纳大学) Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型在视觉-语言任务中的应用,探讨了其架构、训练方法及挑战,并提供了理论与实践的全面指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17808 2025-12-01 cs.CL 88%

PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese

PoETa v2:迈向更稳健的葡萄牙语大型语言模型评估

Thales Sales Almeida, Ramon Pires, Hugo Abonizio, Rodrigo Nogueira, Hélio Pedrini

机构 * Institute of Computing, University of Campinas (UNICAMP)(计算学院,坎皮纳斯大学) School of Electrical and Computer Engineering, University of Campinas (UNICAMP)(电气与计算机工程学院,坎皮纳斯大学) Maritaca AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PoETa v2通过评估超过20个葡萄牙语模型,揭示计算投入和语言适应对性能的影响,并分析与英语任务的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21339 2025-11-27 cs.CV cs.AI 88%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13693 2025-11-27 cs.CL 88%

Evaluating Large Language Models for Radiology Natural Language Processing

评估大型语言模型用于放射学自然语言处理

Zhengliang Liu, Tianyang Zhong, Yiwei Li, Yutong Zhang, Yi Pan, Zihao Zhao, Peixin Dong, Chao Cao, Yuxiao Liu, Peng Shu, Yaonai Wei, Zihao Wu, Chong Ma, Jiaqi Wang, Sheng Wang, Mengyue Zhou, Zuowei Jiang, Chunlin Li, Jason Holmes, Shaochen Xu, Lu Zhang, Haixing Dai, Kai Zhang, Lin Zhao, Yuanhao Chen, Xu Liu, Peilong Wang, Junhao Chen, Pingkun Yan, Jun Liu, Bao Ge, Lichao Sun, Dajiang Zhu, Xiang Li, Wei Liu, Xiaoyan Cai, Xintao Hu, Xi Jiang, Shu Zhang, Xin Zhang, Tuo Zhang, Shijie Zhao, Quanzheng Li, Hongtu Zhu, Dinggang Shen, Tianming Liu

机构 * School of Biomedical Engineering, ShanghaiTech University(上海科技大学生物医学工程学院) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Institute of Medical Research, Northwestern Polytechnical University(西北工业大学医学研究所) School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院) Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯理工大学计算机科学与工程系) Lingang Laboratory, Shanghai(上海灵冈实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估32个大型语言模型在解读放射学报告中的能力,以改进放射学自然语言处理的应用

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01341 2025-11-26 cs.CL 88%

TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models

TurnBench-MS: 一个评估大语言模型多轮多步推理能力的基准

Yiran Zhang, Mo Wang, Xiaoyang Li, Kaixuan Ren, Chencheng Zhu, Usman Naseem

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 TurnBench-MS通过互动破码任务评估大语言模型的多轮多步推理能力,揭示当前模型在复杂推理任务中的显著不足。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2025

Journal ref Findings of the ACL: EMNLP 2025, pp. 19892-19924, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18933 2025-11-25 cs.CR cs.AI 88%

Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations

用负责任的AI考虑来防御大型语言模型对抗劫持攻击

Ryan Wong, Hosea David Yu Fei Ng, Dhananjai Sharma, Glenn Jun Jie Ng, Kavishvaran Srinivasan

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出三种防御策略,通过提示级、logit引导和领域特定代理方法,有效降低大型语言模型的劫持攻击成功率。

Comments 20 pages including appendix; technical report; NeurIPS 2024 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18848 2025-11-25 cs.CL 88%

Large Language Models for the Summarization of Czech Documents: From History to the Present

大型语言模型在捷克文件摘要中的应用:从历史到现代

Václav Tran, Jakub Šmíd, Ladislav Lenc, Jean-Pierre Salmon, Pavel Král

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NTIS - New Technologies for the Information Society(信息社会新技术) LaBRI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文利用大型语言模型和翻译方法,展示了在捷克语历史文档摘要中的新成果,并引入了新的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17511 2025-11-25 cs.HC cs.AI 88%

A Multidisciplinary Design and Optimization (MDO) Agent Driven by Large Language Models

由大型语言模型驱动的多学科设计与优化(MDO)代理

Bingkun Guo, Wentian Li, Xiaojian Liu, Jiaqi Luo, Zibin Yu, Dalong Dong, Shuyou Zhang, Yiming Zhang

机构 * State Key Laboratory of Fluid Power Transmission and Control(流体动力传动与控制国家重点实验室) School of Aeronautics and Astronautics(航空宇航科学与技术学院) China Ship Development and Design Center(船舶设计发展研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 由大型语言模型驱动的MDO代理通过参数建模、知识引导和智能协调实现机械设计的自动化与创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22688 2025-11-25 cs.SE cs.AI cs.PL 88%

CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation

CodeIF-Bench: 评估大型语言模型在交互式代码生成中的指令遵循能力

Peiding Wang, Li Zhang, Fang Liu, Lin Shi, Minxiao Li, Bo Shen, An Fu

机构 * School of Computer Science & Engineering, State Key Laboratory of Complex & Critical Software Environment, Beihang University(计算机科学与工程学院、复杂与关键软件环境国家重点实验室、北京航空航天大学) School of Software, Beihang University(软件学院、北京航空航天大学) Huawei Cloud Computing Technologies Co., Ltd. China(华为云计算技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 CodeIF-Bench通过九种可验证指令评估LLMs在多轮交互中的指令遵循能力,揭示了上下文管理对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15722 2025-11-21 cs.AI 88%

Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods

多模态大语言模型中的空间推理:任务、基准和方法的调查

Weichen Liu, Qiyao Xue, Haoming Wang, Xiangyu Yin, Boyuan Yang, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文调查多模态大语言模型中的空间推理问题,从认知角度分类任务和基准,分析评估方法与改进策略,揭示模型与人类推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01418 2025-11-20 cs.CL 88%

On the Alignment of Large Language Models with Global Human Opinion

Yang Liu, Masahiro Kaneko, Chenhui Chu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14342 2025-11-20 cs.CL 88%

ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions

Xingwei He, Qianru Zhang, Pengfei Chen, Guanhua Chen, Linlin Yu, Yuan Yuan, Siu-Ming Yiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11299 2025-11-17 cs.CV cs.AI 88%

AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models

Haokun Chen, Jianing Li, Yao Zhang, Jinhe Bi, Yan Xia, Jindong Gu, Volker Tresp

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments AAAI 2026. Code: https://github.com/HaokunChen245/AUVIC

详情

展开后加载摘要…

URL PDF HTML 收藏