arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-24 至 2025-11-24 共收录 115 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 23 篇

2511.16837 2025-11-24 cs.AI cs.CL 82%

Cognitive BASIC: An In-Model Interpreted Reasoning Language for LLMs

认知BASIC:一种用于大语言模型的内部解释推理语言

Oliver Kramer

机构 * Computational Intelligence Group University of Oldenburg(奥尔登堡大学计算智能组)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Cognitive BASIC通过简单命令实现LLM内部透明推理,展示了多步骤推理和矛盾解决能力。

Comments 6 pages, Submitted to ESANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04736 2025-11-24 cs.AI 81%

The promise and limits of LLMs in constructing proofs and hints for logic problems in intelligent tutoring systems

大型语言模型在智能辅导系统中构建证明和提示的潜力与限制

Sutapa Dey Tithi, Arun Kumar Ramesh, Clara DiMarco, Xiaoyi Tian, Nazia Alam, Kimia Fazeli, Tiffany Barnes

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究评估了大型语言模型在智能辅导系统中构建逻辑证明和生成提示的潜力与限制,发现DeepSeek-V3在证明构建上表现优异,但生成的提示在解释原因和背景方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24068 2025-11-24 cs.LG cs.AI 81%

A Small Math Model: Recasting Strategy Choice Theory in an LLM-Inspired Architecture

一个小数学模型:在LLM启发式架构中重构策略选择理论

Roussel Rahman, Jeff Shrager

机构 * Stanford University(斯坦福大学) Bennu Climate, Inc.(Bennu气候公司)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于LLM架构的小数学模型,重构策略选择理论,扩展其功能并研究数学推理中的数字特征与关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17473 2025-11-24 cs.CL cs.AI cs.LG 80%

Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards

基于掩码与重排的自监督学习用于可验证奖励的强化学习

Zhen Wang, Zhifeng Gao, Guolin Ke

机构 * DP Technology(DP技术)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MR-RLVR方法,通过掩码与重排自监督学习提升RLVR在仅结果可验证场景下的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07772 2025-11-24 cs.CR cs.AI cs.CL cs.LG 80%

SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought

SALT: 通过泄漏自由思考引导激活以避免链式思维中的信息泄露

Shourya Batra, Pierce Tillman, Samarth Gaggar, Shashank Kesineni, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma, Maheep Chaudhary

机构 * Independent(独立研究者) RAND University of Maryland(马里兰大学) META Algoverse

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SALT通过在链式思维中注入引导向量减少隐私泄露,提升模型隐私保护能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17036 2025-11-24 cs.CL cs.CV 79%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13290 2025-11-24 cs.PL cs.AI 79%

Towards Formal Verification of LLM-Generated Code from Natural Language Prompts

向自然语言提示生成的LLM代码形式验证

Aaron Councilman, David Jiahao Fu, Aryan Gupta, Chengxiao Wang, David Grove, Yu-Xiong Wang, Vikram Adve

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 Astrogator通过形式查询语言和知识库实现对LLM生成代码的正确性验证,验证准确率达83%。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16885 2025-11-24 cs.CL 70%

Improving Latent Reasoning in LLMs via Soft Concept Mixing

通过软概念混合改进大语言模型的潜在推理

Kang Wang, Xiangyu Duan, Tianyi Du

机构 * School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过引入Soft Concept Mixing方法,改进大语言模型的潜在推理能力,提升推理性能并保持训练稳定性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08708 2025-11-24 cs.RO cs.AI cs.CV 70%

PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly

PhyBlock:通过3D积木组装实现物理理解和规划的渐进性基准

Liang Ma, Jiajun Wen, Min Lin, Rongtao Xu, Xiwen Liang, Bingqian Lin, Jun Ma, Yongxin Wang, Ziming Wei, Haokun Lin, Mingfei Han, Meng Cao, Bokui Chen, Ivan Laptev, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) Spatialtemporal AI(时空人工智能) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 PhyBlock通过3D积木组装任务评估VLMs在物理理解和规划能力,揭示其在复杂任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12972 2025-11-24 cs.CV cs.AI 70%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17308 2025-11-24 cs.CV 67%

SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion

SpatialGeo:通过几何-语义融合提升多模态大语言模型的空间推理能力

Jiajie Guo, Qingpeng Zhu, Jin Zeng, Xiaolong Wu, Changyong He, Weida Wang

机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(计算机科学与技术学院,同济大学,上海,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SpatialGeo通过几何-语义融合提升多模态大语言模型的空间推理能力,实验表明在空间推理任务中准确率提升8.0%且内存消耗减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17094 2025-11-24 cs.CV 67%

Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models

稀疏推理已足够:基于生物启发的视频异常检测大预训练模型框架

He Huang, Zixuan Hu, Dongxiao Li, Yao Xiao, Ling-Yu Duan

机构 * School of Computer Science Peking University(北京大学计算机科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ReCoVAD通过生物启发的双通路框架实现视频异常检测,利用稀疏推理降低计算成本,取得最佳无训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18267 2025-11-24 cs.HC 67%

From Checking to Sensemaking: A Caregiver-in-the-Loop Framework for AI-Assisted Task Verification in Dementia Care

从验证到理解:一种护理人员在循环框架中的AI辅助任务验证方法用于痴呆症护理

Joy Lai, Kelly Beaton, David Black, Bing Ye, Alex Mihailidis

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种护理人员在循环框架中的AI辅助任务验证方法,通过生成式AI支持照护者主导的任务验证,提升痴呆症护理中的信任与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23463 2025-11-24 cs.CV 67%

OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model

OpenDriveVLA: 向端到端自动驾驶迈进的大型视觉语言动作模型

Xingcheng Zhou, Xuyuan Han, Feng Yang, Yunpu Ma, Volker Tresp, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 OpenDriveVLA基于开源大语言模型,通过多模态输入和分层视觉语言对齐,实现端到端自动驾驶中的高精度轨迹规划和驾驶任务回答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17400 2025-11-24 cs.CV cs.AI 57%

Sparse Mixture-of-Experts for Multi-Channel Imaging: Are All Channel Interactions Required?

稀疏专家混合模型用于多通道成像:所有通道交互都必要吗?

Sukwon Yun, Heming Yao, Burkhard Hoeckendorf, David Richmond, Aviv Regev, Russell Littman

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Research and Early Development (gRED), Genentech(基因泰克研发与早期开发部) Biology Research — AI Development (BRAID), Genentech(基因泰克生物学研究——人工智能开发部)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出MoE-ViT,通过稀疏专家混合模型优化多通道图像处理,提升效率而不牺牲性能。

Comments This has been accepted at the NeurIPS AI4Science Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16825 2025-11-24 cs.CV cs.AI 57%

WorldGen: From Text to Traversable and Interactive 3D Worlds

WorldGen: 从文本到可遍历和交互的3D世界

Dilin Wang, Hyunyoung Jung, Tom Monnier, Kihyuk Sohn, Chuhang Zou, Xiaoyu Xiang, Yu-Ying Yeh, Di Liu, Zixuan Huang, Thu Nguyen-Phuoc, Yuchen Fan, Sergiu Oprea, Ziyan Wang, Roman Shapovalov, Nikolaos Sarafianos, Thibault Groueix, Antoine Toisoul, Prithviraj Dhar, Xiao Chu, Minghao Chen, Geon Yeong Park, Mahima Gupta, Yassir Azziz, Rakesh Ranjan, Andrea Vedaldi

机构 * Reality Labs, Meta(Meta现实实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 WorldGen通过结合LLM、程序生成和扩散模型,实现从文本到可交互3D世界的自动创建,提升虚拟空间的生成效率与表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 27 篇

2507.04224 2025-11-24 cs.CL cs.AI cs.DL 90%

Fairness Evaluation of Large Language Models in Academic Library Reference Services

学术图书馆参考服务中大型语言模型的公平性评估

Haining Wang, Jason Clark, Yueru Yan, Star Bradley, Ruiyang Chen, Yiqiong Zhang, Hengyi Fu, Zuoyu Tian

机构 * Indiana University(印第安纳大学) Montana State University(蒙塔纳州立大学) Wuhan University(武汉大学) Guangdong University of Foreign Studies(广东外语外贸大学) San José State University(圣何塞州立大学) Macalester College(麦基尔学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在学术图书馆参考服务中对不同用户身份的公平性,发现其在种族和民族上无差异,但存在对女性的轻微刻板印象偏见,显示其在公平沟通方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16707 2025-11-24 cs.SE cs.AI 89%

Large language models for automated PRISMA 2020 adherence checking

基于大型语言模型的自动PRISMA 2020合规性检查

Yuki Kataoka, Ryuhei So, Masahiro Banno, Yasushi Tsujimoto, Tomohiro Takayama, Yosuke Yamagishi, Takahiro Tsuge, Norio Yamamoto, Chiaki Suda, Toshi A. Furukawa

机构 * Center for Postgraduate Clinical Training and Career Development, Nagoya University Hospital(名古屋大学医院研究生临床培训与职业发展中心) Center for Medical Education, Graduate School of Medicine, Nagoya University(名古屋大学医学研究生院医学教育中心) Scientific Research Works Peer Support Group (SRWS-PSG)(科学研究作品同伴支持组) Department of Internal Medicine, Kyoto Min-iren Asukai Hospital(京都Min-iren Asukai医院内科学部) Department of Healthcare Epidemiology, Kyoto University Graduate School of Medicine / School of Public Health(京都大学医学研究院/公共卫生学院卫生流行病学部) Department of International and Community Oral Health, Tohoku University Graduate School of Dentistry(东京东医齿学研究院国际与社区口腔健康部) Department of Psychiatry, Okayama Psychiatric Medical Center(冈山精神医学中心精神病学部) CureApp, Inc.(CureApp公司) Department of Psychiatry, Seichiryo Hospital(Seichiryo医院精神病学部) Oku medical clinic(Oku医疗诊所) Department of Health Promotion and Human Behavior, Kyoto University Graduate School of Medicine / School of Public Health(京都大学医学研究院/公共卫生学院健康促进与人类行为部) Kyoto University Hospital(京都大学医院) Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo(东京大学医学研究生院放射学与生物医学工程部) Department of Rehabilitation, Kurashiki Medical Centre(Kurashiki医疗中心康复部) Department of Epidemiology, Graduate School of Medicine, Dentistry, and Pharmaceutical Sciences, Okayama University(冈山大学医学、牙科和药学研究生院流行病学部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型自动检查PRISMA 2020合规性,通过结构化检查清单显著提升评估准确率,但需人类专家验证以确保编辑决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16688 2025-11-24 cs.CL cs.AI 88%

Prompt-Based Value Steering of Large Language Models

基于提示的价值引导大型语言模型

Giulio Antonio Abbo, Tony Belpaeme

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于提示的价值引导方法,通过评估提示候选者对生成文本的价值引导能力,展示在不修改模型的情况下实现价值对齐的可行性。

Comments 9 pages, 1 figure, 4 tables. Presented at the 3rd International Workshop on Value Engineering in AI (VALE 2025), 28th European Conference on AI. To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18883 2025-11-24 cs.CV 88%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16883 2025-11-24 cs.LG 85%

PersonalizedRouter: Personalized LLM Routing via Graph-based User Preference Modeling

PersonalizedRouter: 通过基于图的用户偏好建模实现个性化LLM路由

Zhongjie Dai, Tao Feng, Jiaxuan You

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PersonalizedRouter通过基于图的用户偏好建模,实现个性化LLM选择,显著优于现有方法,具有高效和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23662 2025-11-24 cs.CL 83%

ToolHaystack: Stress-Testing Tool-Augmented Language Models in Realistic Long-Term Interactions

ToolHaystack: 在现实长期交互中压力测试工具增强的语言模型

Beong-woo Kwak, Minju Kim, Dongha Lim, Hyungjoo Chae, Dongjin Kang, Sunghwan Kim, Dongil Yang, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Department of Computer Science & Engineering, Yonsei University(计算机科学与工程系,延世大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 ToolHaystack通过模拟现实长期交互中的噪声和上下文干扰,揭示了现有工具增强语言模型在长期鲁棒性方面的不足。

Comments Our code and data are available at https://github.com/bwookwak/ToolHaystack Edited for adding acknowledgement section

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16743 2025-11-24 cs.CV cs.AI cs.LG 81%

SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge

SafeR-CLIP: 通过保留预训练知识来缓解视觉-语言模型中的不适宜内容

Adeel Yousaf, Joseph Fioresi, James Beetham, Amrit Singh Bedi, Mubarak Shah

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 SafeR-CLIP通过最小化干预策略,在保留预训练知识的同时提升视觉-语言模型的安全性,实现性能与安全性的平衡。

Comments AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01478 2025-11-24 cs.CL cs.AI cs.LG 80%

SePer: Measure Retrieval Utility Through The Lens Of Semantic Perplexity Reduction

SePer:通过语义困惑度降低的视角衡量检索效用

Lu Dai, Yijie Xu, Jinhui Ye, Hao Liu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SePer通过语义困惑度降低衡量检索效用,提供更精确的RAG评估方法

Comments ICLR 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17432 2025-11-24 cs.CL cs.AI cs.CV 79%

SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation

SMILE:一种用于问答评估的复合词法-语义度量标准

Shrikant Kendre, Austin Xu, Honglu Zhou, Michael Ryoo, Shafiq Joty, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SMILE是一种结合句子级和关键词级语义理解的新型问答评估度量标准,通过平衡词法精确性与语义相关性,提供全面且高效的评估方法。

Comments 23 pages, 6 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17309 2025-11-24 cs.AI cs.CL 79%

RubiSCoT: A Framework for AI-Supported Academic Assessment

RubiSCoT:一种支持人工智能的学术评估框架

Thorsten Fröhlich, Tim Schlippe

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 RubiSCoT通过人工智能技术提升学术论文评估的效率和一致性,提供从提案到最终提交的全面评估解决方案。

Journal ref The 6th International Conference on Artificial Intelligence in Education Technology (AIET 2025), Munich, Germany, 29-31 July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16853 2025-11-24 cs.CV 78%

Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation

面向地球观测森林生态分析的统一视觉语言模型

Xizhe Xue, Xiao Xiang Zhu

机构 * Xizhe Xue 1, 2 Xiao Xiang Zhu 1, 2

专题命中 评测与基准 :language model(title,abstract)

AI总结 REO-Instruct提出首个面向地球观测森林生态分析的统一视觉语言模型基准,旨在解决描述与回归任务中的多模态感知与生物物理变量对齐问题。

Comments AAAI2026 AI for Environmental Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17153 2025-11-24 cs.CL 77%

LangMark: A Multilingual Dataset for Automatic Post-Editing

LangMark: 一种多语言数据集用于自动后编辑

Diego Velazquez, Mikaela Grace, Konstantinos Karageorgos, Lawrence Carin, Aaron Schliem, Dimitrios Zaikis, Roger Wechsler

机构 * Welocalize(韦洛卡兹) Duke University(杜克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 LangMark是一个多语言数据集,用于评估和改进自动后编辑系统,通过大规模标注数据展示大型语言模型在后编辑任务中的有效性。

Comments 15 pages, 8 figures, ACL 2025

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2025, pages 32653-32667

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16683 2025-11-24 cs.CL cs.AI 73%

How Well Do LLMs Understand Tunisian Arabic?

LLMs对突尼斯阿拉伯语的理解程度如何?

Mohamed Mahdi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建包含突尼斯阿拉伯语、标准阿拉伯语和英语的平行数据集,评估了多种LLMs在转写、翻译和情感分析任务上的表现,揭示了模型在理解突尼斯方言方面的差异与局限,强调了在AI系统中纳入低资源语言的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16937 2025-11-24 cs.CV cs.AI 70%

OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios

OmniGround: 一个全面的时空接地基准用于现实复杂场景

Hong Gao, Jingyu Wu, Xiangkai Xu, Kangni Xie, Yunchen Zhang, Bin Zhong, Xurui Gao, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OmniGround提出一个全面的时空接地基准,通过改进的标注流程和评估框架,提升了复杂现实场景中视频目标定位的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏