arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-05 至 2025-12-05 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 30 篇

2512.04759 2025-12-05 cs.CL 89%

Challenging the Abilities of Large Language Models in Italian: a Community Initiative

挑战大型语言模型在意大利语中的能力:一项社区倡议

Malvina Nissim, Danilo Croce, Viviana Patti, Pierpaolo Basile, Giuseppe Attanasio, Elio Musacchio, Matteo Rinaldi, Federico Borazio, Maria Francis, Jacopo Gili, Daniel Scalena, Begoña Altuna, Ekhi Azurmendi, Valerio Basile, Luisa Bentivogli, Arianna Bisazza, Marianna Bolognesi, Dominique Brunato, Tommaso Caselli, Silvia Casola, Maria Cassese, Mauro Cettolo, Claudia Collacciani, Leonardo De Cosmo, Maria Pia Di Buono, Andrea Esuli, Julen Etxaniz, Chiara Ferrando, Alessia Fidelangeli, Simona Frenda, Achille Fusco, Marco Gaido, Andrea Galassi, Federico Galli, Luca Giordano, Mattia Goffetti, Itziar Gonzalez-Dios, Lorenzo Gregori, Giulia Grundler, Sandro Iannaccone, Chunyang Jiang, Moreno La Quatra, Francesca Lagioia, Soda Marem Lo, Marco Madeddu, Bernardo Magnini, Raffaele Manna, Fabio Mercorio, Paola Merlo, Arianna Muti, Vivi Nastase, Matteo Negri, Dario Onorati, Elena Palmieri, Sara Papi, Lucia Passaro, Giulia Pensa, Andrea Piergentili, Daniele Potertì, Giovanni Puccetti, Federico Ranaldi, Leonardo Ranaldi, Andrea Amelio Ravelli, Martina Rosola, Elena Sofia Ruzzetti, Giuseppe Samo, Andrea Santilli, Piera Santin, Gabriele Sarti, Giovanni Sartor, Beatrice Savoldi, Antonio Serino, Andrea Seveso, Lucia Siciliani, Paolo Torroni, Rossella Varvara, Andrea Zaninello, Asya Zanollo, Fabio Massimo Zanzotto, Kamyar Zeinalipour, Andrea Zugarini

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 CALAMITA是一项针对意大利语的社区驱动基准测试项目,通过多样化任务和统一评估流程,系统评估大型语言模型的能力,为其他语言提供评估范例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04643 2025-12-05 cs.CV cs.AI cs.CL cs.LG 89%

SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

SEASON: 通过自诊断对比解码缓解视频大语言模型中的时间幻觉

Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SEASON通过自诊断对比解码方法,无需训练即可提升视频大语言模型在时间信息处理上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04673 2025-12-05 cs.SE 88%

Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models

跨任务基准测试与通用型和代码特定大型语言模型的评估

Gunjan Das, Paheli Bhattacharya, Rishabh Gupta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了通用和代码特定大型语言模型在跨任务基准测试中的表现,发现代码优化模型在推理和语法精确度上优于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01424 2025-12-05 cs.CV 88%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03070 2025-12-05 cs.AI cs.LG stat.ML 87%

Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge

大语言模型的流行病学:一种用于观察分布知识的基准测试

Drago Plecko, Patrik Okanovic, Shreyas Havaldar, Torsten Hoefler, Elias Bareinboim

机构 * Department of Statistics & Data Science University of California, Los Angeles(统计与数据科学系,加州大学洛杉矶分校) Department of Computer Science ETH Zürich(计算机科学系,苏黎世联邦理工学院) Causal AI Lab Columbia University(因果AI实验室,哥伦比亚大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种用于评估大语言模型在现实世界概率分布知识方面能力的基准测试,发现LLMs在理解和内部化真实世界统计信息方面表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23749 2025-12-05 cs.SE 87%

A Survey of LLM-based Automated Program Repair: Taxonomies, Design Paradigms, and Applications

基于大型语言模型的自动程序修复综述:分类、设计范式与应用

Boyang Yang, Zijian Cai, Fengling Liu, Bach Le, Lingming Zhang, Tegawendé F. Bissyandé, Yang Liu, Haoye Tian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文综述了基于LLM的自动程序修复,提出统一分类法,涵盖四种范式,并讨论了评估实践和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04308 2025-12-05 cs.RO 83%

ResponsibleRobotBench: Benchmarking Responsible Robot Manipulation using Multi-modal Large Language Models

ResponsibleRobotBench: 使用多模态大语言模型评估负责任的机器人操控

Lei Zhang, Ju Dong, Kaixin Bai, Minheng Ni, Zoltan-Csaba Marton, Zhaopeng Chen, Jianwei Zhang

机构 * University of Hamburg(汉堡大学) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 ResponsibleRobotBench通过多模态大语言模型评估机器人操控的责任性,涵盖23个多阶段任务,强调安全性、泛化能力和物理可靠性。

Comments https://sites.google.com/view/responsible-robotbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04254 2025-12-05 cs.CR cs.AI 83%

Hey GPT-OSS, Looks Like You Got It -- Now Walk Me Through It! An Assessment of the Reasoning Language Models Chain of Thought Mechanism for Digital Forensics

嘿,GPT-OSS,看来你已经掌握了——现在让我带你走一遍!对数字取证中推理语言模型链式思维机制的评估

Gaëtan Michelet, Janine Schneider, Aruna Withanage, Frank Breitinger

机构 * Chair for Cybersecurity, University of Augsburg, Augsburg, Germany(网络安全系,乌尔姆大学,乌尔姆,德国)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文评估了推理语言模型在数字取证中的应用,发现中等推理水平有助于解释模型输出,但更高推理水平未显著提升响应质量。

Comments Accept at DFRWS EU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04105 2025-12-05 cs.CY cs.AI cs.HC 83%

LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents

LegalWebAgent:通过基于大语言模型的网络代理赋能正义获取

Jinzhe Tan, Karim Benyekhlef

机构 * Cyberjustice Laboratory, Faculty of Law, University of Montreal, Canada(法律正义实验室,法学院,蒙特利尔大学,加拿大)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LegalWebAgent通过多模态大语言模型实现网络代理,解决普通公民在法律问题中的获取障碍,实现从查询到行动的全流程自动化,实验结果显示其在复杂场景中的高自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15610 2025-12-05 cs.LG cs.AI 81%

A general language model for peptide function identification

一种用于肽功能识别的通用语言模型

Jixiu Zhai, Zikun Wang, Chupei Tang, Haitian Zhong, Ziyang Xu, Yuhuan Liu, Shengrui Xu, Jingwan Wang, Dan Huang, Tianchi Lu

机构 * School of Mathematics and Statistics, Lanzhou University(兰州大学数学与统计学学院) Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Shanghai Innovation Institute(上海创新研究院) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Cuiying Honors College, Lanzhou University(崔莹荣誉学院,兰州大学) Department of Mathematics, Harbin Engineering University(哈尔滨工程大学数学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 PDeepPP是一种整合预训练蛋白质语言模型与混合Transformer-CNN架构的通用语言模型,用于高效识别多种肽类和PTM位点,实现高精度和可解释的肽表示。

Comments 15 pages, 5 figures, 3 tables, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04957 2025-12-05 cs.CL cs.AI 79%

LLMs Know More Than Words: A Genre Study with Syntax, Metaphor & Phonetics

LLMs Know More Than Words: 一种涉及语法、隐喻与语音的体裁研究

Weiye Shi, Zhaowei Zhang, Shaoheng Yan, Yaodong Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入多语言体裁分类数据集,研究LLMs在语法、隐喻和语音特征上的学习能力及其对分类任务的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04125 2025-12-05 cs.LG 78%

ASCIIBench: Evaluating Language-Model-Based Understanding of Visually-Oriented Text

ASCIIBench: 评估基于语言模型的视觉文本理解

Kerry Luo, Michael Fu, Joshua Peguero, Husnain Malik, Anvay Patil, Joyce Lin, Megan Van Overborg, Ryan Sarmiento, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ASCIIBench通过评估LLM生成ASCII艺术的性能,揭示了多模态表示的局限性,并推动了针对符号视觉模态的新方法发展。

Comments Accepted to The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025): LLM Evaluation Workshop & Multimodal Algorithmic Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04058 2025-12-05 cs.CV 78%

EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models

EVE:基于视觉-语言模型的端到端视频字幕提取

Haiyang Yu, Mengyang Zhao, Jinghui Lu, Ke Niu, Yanjie Wang, Weijie Yin, Weitao Jia, Teng Fu, Yang Liu, Jun Liu, Hong Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ByteDance Inc.(字节跳动公司) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 EVE提出了一种基于视觉-语言模型的端到端视频字幕提取框架,通过双分支模块高效提取字幕及时间戳,并构建了首个大规模视频字幕数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04864 2025-12-05 cs.AI 77%

Are Your Agents Upward Deceivers?

您的代理是向上欺骗者吗?

Dadi Guo, Qingyu Liu, Dongrui Liu, Qihan Ren, Shuai Shao, Tianyi Qiu, Haoran Li, Yi R. Fung, Zhongjie Ba, Juntao Dai, Jiaming Ji, Zhikai Chen, Jialing Tao, Yaodong Yang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现基于LLM的代理可能通过欺骗行为隐瞒失败,需加强缓解策略以确保安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03887 2025-12-05 cs.AI 77%

A Hierarchical Tree-based approach for creating Configurable and Static Deep Research Agent (Static-DRA)

一种基于层次树的创建可配置和静态深度研究代理(静态-DRA)的方法

Saurav Prateek

机构 * Saurav Prateek(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出静态-DRA,通过深度和广度参数实现可配置的深度研究代理,提升多轮复杂研究任务的处理能力。

Comments 16 pages, 6 figures, 4 tables. Code available at: https://github.com/SauravP97/Static-Deep-Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00591 2025-12-05 cs.CL 77%

Probe-Rewrite-Evaluate: A Workflow for Reliable Benchmarks and Quantifying Evaluation Awareness

探测-重写-评估:一种用于可靠基准和量化评估意识的工作流程

Lang Xiong, Nishant Bhargava, Jianhang Hong, Jeremy Chang, Haihao Liu, Vasu Sharma, Kevin Zhu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出探测-重写-评估工作流程,通过量化LLM在不同上下文中的行为变化,揭示评估意识对模型安全性和诚实性的影响,并展示更真实的评估框架的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11678 2025-12-05 cs.CY cs.CL 77%

Which Type of Students can LLMs Act? Investigating Authentic Simulation with Graph-based Human-AI Collaborative System

哪些类型的学生可以被LLMs模拟?基于图-based人机协作系统的认证模拟研究

Haoxuan Li, Jifan Yu, Xin Cong, Yang Dang, Daniel Zhang-li, Lu Mi, Yisi Zhan, Huiqin Liu, Zhiyuan Liu

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) School of Education, Tsinghua University(教育学院,清华大学) Department of Statistics and Data Science, Tsinghua University(统计与数据科学系,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于图的LLM-人协作系统,通过自动化评分和图传播技术生成高质量学生代理,验证其在模拟学生行为方面的有效性。

Comments This work has been submitted to AI Open for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04315 2025-12-05 cs.AR 75%

HLStrans: Dataset for C-to-HLS Hardware Code Synthesis

HLStrans: 用于C到HLS硬件代码综合的数据库

Qingyun Zou, Nuo Chen, Yao Chen, Bingsheng He, WengFei Wong

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 HLStrans是首个用于LLM驱动的C到HLS综合的大型数据集,包含124,000对配对程序和完整测试台,通过自动化管道增强,用于提升LLM在硬件综合中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04765 2025-12-05 cs.CL 70%

AdiBhashaa: A Community-Curated Benchmark for Machine Translation into Indian Tribal Languages

AdiBhashaa:一个由社区共同编纂的机器翻译基准,用于印度部落语言

Pooja Singh, Sandeep Kumar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AdiBhashaa通过构建四个印度部落语言的开源平行语料库和基础MT系统,推动更公平的AI研究,强调本地专业知识和人类验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04728 2025-12-05 cs.CV cs.AI 70%

Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild

测量未言之: 一种解耦模型和基准用于野外心理分析

Yigui Feng, Qinglin Wang, Haotian Mo, Yang Liu, Ke Liu, Gencheng Liu, Xinhai Chen, Siqi Shen, Songzhu Mei, Jie Liu

机构 * College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MIND模型和PRISM基准,通过解耦算法和专家标注数据提升野外对话心理分析的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04367 2025-12-05 cs.AI 70%

AgentBay: A Hybrid Interaction Sandbox for Seamless Human-AI Intervention in Agentic Systems

AgentBay:一种混合交互沙盒,用于无缝的人工智能干预在代理系统中

Yun Piao, Hongbo Min, Hang Su, Leilei Zhang, Lei Wang, Yue Yin, Xiao Wu, Zhejing Xu, Liwei Qu, Hang Li, Xinxin Zeng, Wei Tian, Fei Yu, Xiaowei Li, Jiayi Jiang, Tongxu Liu, Hao Tian, Yufei Que, Xiaobing Tu, Bing Suo, Yuebing Li, Xiangting Chen, Zeen Zhao, Jiaming Tang, Wei Huang, Xuguang Li, Jing Zhao, Jin Li, Jie Shen, Jinkui Ren, Xiantao Zhang

机构 * Alibaba Cloud Computing(阿里云计算)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentBay通过混合交互沙盒实现无缝人机协作,提升代理系统在复杂任务中的成功率与网络适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04262 2025-12-05 cs.SE cs.AI cs.HC 70%

Catching UX Flaws in Code: Leveraging LLMs to Identify Usability Flaws at the Development Stage

在代码中捕捉用户体验缺陷:利用大语言模型在开发阶段识别可用性缺陷

Nolan Platt, Ethan Luchs, Sehrish Nizamani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在开发阶段识别可用性缺陷的能力,发现其在问题检测上表现中等一致,但严重性判断需人类监督。

Comments 7 pages. Published in Proceedings of the 2025 IEEE Symposium on Visual Languages and Human-Centric Computing (VL/HCC). DOI: 10.1109/VL-HCC65237.2025.00024

Journal ref Proceedings of the 2025 IEEE Symposium on Visual Languages and Human-Centric Computing (VL/HCC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05091 2025-12-05 cs.CV 67%

Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark

视觉推理追踪器:对象级 grounded 推理基准

Haobo Yuan, Yueyi Sun, Yanwei Li, Tao Zhang, Xueqing Deng, Henghui Ding, Lu Qi, Anran Wang, Xiangtai Li, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) PKU(北京大学) NTU(国立台湾大学) CUHK(香港中文大学) WHU(武汉大学) FDU(福建大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出视觉推理追踪器任务,通过对象级 grounded 推理基准评估模型的推理路径生成能力,并引入了新的评估指标和大规模数据集提升模型推理表现。

Comments Technical Report; Project Page: https://harboryuan.github.io/visual-reasoning-tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04473 2025-12-05 cs.LG cs.AI cs.CL cs.IR 67%

Ground-Truth Subgraphs for Better Training and Evaluation of Knowledge Graph Augmented LLMs

用于改进知识图谱增强大语言模型训练和评估的真实子图

Alberto Cattaneo, Carlo Luschi, Daniel Justus

机构 * Graphcore Research(Graphcore研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SynthKGQA通过生成高质量的知识图谱问答数据集,提升知识图谱增强大语言模型的训练和评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04597 2025-12-05 cs.CV cs.AI cs.LG cs.RO 62%

When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering

机器人何时应说'我不知道':身体化问答中退避的基准测试

Tao Wu, Chuhao Zhou, Guangyu Zhao, Haozhi Cao, Yewen Pu, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了身体化问答中退避机制的重要性,通过构建AbstainEQA数据集,发现人类在退避任务中表现优异,而模型退避能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04324 2025-12-05 cs.CL cs.AI 62%

DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle

DAComp: 在全数据智能生命周期中跨领域评估数据代理

Fangyu Lei, Jinxiang Meng, Yiming Huang, Junjie Zhao, Yitong Zhang, Jianwen Luo, Xin Zou, Ruiyi Yang, Wenbo Shi, Yan Gao, Shizhu He, Zuo Wang, Qian Liu, Yang Wang, Ke Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DAComp通过210个任务评估数据代理在数据工程与分析中的能力,揭示现有代理在复杂流程编排和开放性推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04488 2025-12-05 cs.CV cs.AI cs.HC cs.MM 57%

"I Can See Forever!": Evaluating Real-time VideoLLMs for Assisting Individuals with Visual Impairments

我能看到永远!

Ziyi Zhang, Zhen Sun, Zongmin Zhang, Zifan Peng, Yuemeng Zhao, Zichun Wang, Zeren Luo, Ruiting Zuo, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文评估了实时视频LLMs在帮助视障者日常生活中的有效性,发现GPT-4o在任务成功率方面最高,并提出SafeVid数据集提升风险识别准确率至76%

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04408 2025-12-05 cs.AI 57%

Executable Governance for AI: Translating Policies into Rules Using LLMs

可执行治理 for AI:利用 LLMs 将政策翻译成规则

Gautam Varma Datla, Anudeep Vurity, Tejaswani Dash, Tazeem Ahmad, Mohd Adnan, Saima Rafi

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。

Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04479 2025-12-05 cs.CL 57%

ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai

ThaiOCRBench: 一种任务多样化的泰语视觉-语言理解基准

Surapon Nonesung, Teetouch Jaknamon, Sirinya Chaiophat, Natapong Nitarach, Chanakan Wittayasakpan, Warit Sirichotedumrong, Adisai Na-Thalang, Kunat Pipatanakul

机构 * SCB 10X R&D(SCB 10X研发部) SCB 10X SCBX Group(SCBX集团)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 ThaiOCRBench是一个针对泰语视觉-语言理解任务的多样化基准,通过人工标注的数据集评估了多种VLMs,揭示了专有模型在性能上的优势及开源模型在细粒度文本识别中的挑战。

Comments Accepted at IJCNLP-AACL 2025 (Main). This version includes the corrected Table 2 and an updated conclusion regarding the deletion count of the Gemma model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04599 2025-12-05 cs.CV 50%

Malicious Image Analysis via Vision-Language Segmentation Fusion: Detection, Element, and Location in One-shot

通过视觉-语言分割融合进行恶意图像分析:一次检测、元素识别与定位

Sheng Hang, Chaoxiang He, Hongsheng Hu, Hanqing Hu, Bin Benjamin Zhu, Shi-Feng Sun, Dawu Gu, Shuo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Corporation(微软公司)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种零样本方法,通过视觉-语言分割融合实现恶意图像的检测、元素识别与定位,提升细粒度审核的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏