arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-27 至 2025-11-27 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 37 篇

2511.19872 2025-11-27 cs.AI 90%

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

大语言模型的模拟自我评估:一种心理测量方法用于AI自我效能

Daniel I Jackson, Emma L Jensen, Syed-Amad Hussain, Emre Sezgin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过心理测量方法评估大语言模型的自我效能,发现模型自我评估与实际表现不一致,且不同任务表现差异显著。

Comments 25 pages,5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15585 2025-11-27 cs.SE cs.CL cs.PL 90%

Leveraging Test Driven Development with Large Language Models for Reliable and Verifiable Spreadsheet Code Generation: A Research Framework

利用大型语言模型进行测试驱动开发以实现可靠且可验证的电子表格代码生成:一种研究框架

Simon Thorne, Advait Sarkar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出一种结合测试驱动开发与大型语言模型的框架,以提高电子表格代码生成的可靠性与准确性。

Comments 16 pages

Journal ref Proceedings of the EuSpRIG 2025 Conference "Spreadsheet Productivity & Risks" ISBN : 978-1-905404-60-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01219 2025-11-27 cs.CL cs.AI 90%

Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset

通过概念学习数据集揭示大型语言模型中的隐性偏见

Leroy Z. Wang

机构 * UPLB(菲律宾大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文通过概念学习数据集揭示大型语言模型在量化词上的隐性偏见,并展示上下文概念学习在发现隐藏偏见中的有效性。

Comments Presented at EurIPS 2025 Workshop - Unifying Perspectives on Learning Biases (UPLB) https://sites.google.com/view/towards-a-unified-view

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21568 2025-11-27 cs.CL 89%

RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions

RoParQ:面向抗 paraphrased 问题的大型语言模型对齐

Minjoon Choi

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL

AI总结 RoParQ 通过引入 XParaCon 指标和基于推理的 SFT 策略,提升 LLM 在 paraphrased 问题上的鲁棒性与一致性。

Comments 12 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09474 2025-11-27 cs.SE cs.AI cs.OS 89%

MigGPT: Harnessing Large Language Models for Automated Migration of Out-of-Tree Linux Kernel Patches Across Versions

MigGPT:利用大语言模型实现跨版本的Linux内核非官方补丁自动化迁移

Pucheng Dang, Di Huang, Dong Li, Kang Chen, Yuanbo Wen, Qi Guo, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MigGPT通过新颖的代码指纹结构和三个精心设计的模块,提高非官方内核补丁迁移的准确性和效率,平均完成率达74.07。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09606 2025-11-27 cs.CR 89%

How Can We Effectively Use LLMs for Phishing Detection?: Evaluating the Effectiveness of Large Language Model-based Phishing Detection Models

如何有效利用大语言模型进行钓鱼检测?:评估基于大语言模型的钓鱼检测模型的有效性

Fujiao Ji, Doowon Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了基于大语言模型的钓鱼检测有效性,发现商业模型在检测中表现更优,截图输入在品牌识别中效果最佳,但需注意温度设置和多模态输入的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20703 2025-11-27 cs.CY cs.AI cs.LG 88%

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

PropensityBench: 通过代理方法评估大语言模型中的潜在安全风险

Udari Madhushani Sehwag, Shayan Shabihi, Alex McAvoy, Vikash Sehwag, Yuancheng Xu, Dalton Towers, Furong Huang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 PropensityBench通过模拟危险能力评估大语言模型的潜在安全风险倾向,揭示模型在压力下可能选择高风险行为的倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21339 2025-11-27 cs.CV cs.AI 88%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13693 2025-11-27 cs.CL 88%

Evaluating Large Language Models for Radiology Natural Language Processing

评估大型语言模型用于放射学自然语言处理

Zhengliang Liu, Tianyang Zhong, Yiwei Li, Yutong Zhang, Yi Pan, Zihao Zhao, Peixin Dong, Chao Cao, Yuxiao Liu, Peng Shu, Yaonai Wei, Zihao Wu, Chong Ma, Jiaqi Wang, Sheng Wang, Mengyue Zhou, Zuowei Jiang, Chunlin Li, Jason Holmes, Shaochen Xu, Lu Zhang, Haixing Dai, Kai Zhang, Lin Zhao, Yuanhao Chen, Xu Liu, Peilong Wang, Junhao Chen, Pingkun Yan, Jun Liu, Bao Ge, Lichao Sun, Dajiang Zhu, Xiang Li, Wei Liu, Xiaoyan Cai, Xintao Hu, Xi Jiang, Shu Zhang, Xin Zhang, Tuo Zhang, Shijie Zhao, Quanzheng Li, Hongtu Zhu, Dinggang Shen, Tianming Liu

机构 * School of Biomedical Engineering, ShanghaiTech University(上海科技大学生物医学工程学院) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Institute of Medical Research, Northwestern Polytechnical University(西北工业大学医学研究所) School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院) Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯理工大学计算机科学与工程系) Lingang Laboratory, Shanghai(上海灵冈实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估32个大型语言模型在解读放射学报告中的能力,以改进放射学自然语言处理的应用

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04231 2025-11-27 cs.LG cs.AI 86%

Empowering Time Series Forecasting with LLM-Agents

用LLM代理增强时间序列预测

Chin-Chia Michael Yeh, Vivian Lai, Uday Singh Saini, Xiran Fan, Yujie Fan, Junpeng Wang, Xin Dai, Yan Zheng

机构 * Visa Research(Visa研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DCATS通过提升数据质量而非模型架构,为时间序列预测的AutoML提供了新的方法,实现了平均6%的误差减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20683 2025-11-27 cs.CL 81%

Dynamic Template Selection for Output Token Generation Optimization: MLP-Based and Transformer Approaches

动态模板选择用于输出标记生成优化:基于MLP和Transformer的方法

Bharadwaj Yadavalli

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出动态模板选择方法,通过MLP和Transformer路由策略优化输出标记生成,实现成本降低与响应质量的平衡。

Comments 20 pages, 4 figures, includes production-scale experiments across OpenAI GPT-4, Google Gemini, and Anthropic Claude; code available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20403 2025-11-27 cs.SE cs.AI 81%

LLMs for Automated Unit Test Generation and Assessment in Java: The AgoneTest Framework

基于大型语言模型的Java自动化单元测试生成与评估:AgoneTest框架

Andrea Lops, Fedelucio Narducci, Azzurra Ragone, Michelantonio Trizio, Claudio Bartolini

机构 * University of Bari, Bari, Italy(巴里大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AgoneTest框架通过标准化评估流程,评估大型语言模型生成的Java单元测试质量,展示其在覆盖率和缺陷检测上的表现,并探讨提示策略对测试质量的影响。

Comments Accepted at 40th IEEE/ACM International Conference on Automated Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20783 2025-11-27 cs.CL 79%

On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey

在预训练语言模型中通用文本嵌入的作用:综述

Meishan Zhang, Xin Zhang, Xinping Zhao, Shouzheng Huang, Baotian Hu, Min Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文综述了预训练语言模型在通用文本嵌入中的作用,探讨了其架构、核心方法及未来研究方向。

Comments 45 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07908 2025-11-27 eess.IV cs.AI cs.CV 79%

ONCOPILOT: A Promptable CT Foundation Model For Solid Tumor Evaluation

ONCOPILOT:一种可提示的CT基础模型用于实体肿瘤评估

Léo Machado, Hélène Philippe, Élodie Ferreres, Julien Khlaut, Julie Dupuis, Korentin Le Floch, Denis Habip Gatenyo, Pascal Roux, Jules Grégory, Maxime Ronot, Corentin Dancette, Tom Boeken, Daniel Tordjman, Pierre Manceron, Paul Hérent

机构 * Raidium, Paris Biotech Santé(Raidium,巴黎生物医疗健康) AP-HP. Nord, Department of Radiology, FHU MOSAIC, Beaujon Hospital(AP-HP. Nord,放射科,FHU MOSAIC,贝琼医院) Université Paris Cité(巴黎城市大学) Université Paris Cité, AP-HP, Hôpital Européen Georges Pompidou, Department of Vascular and Oncological Interventional Radiology(巴黎城市大学,AP-HP,欧文·庞皮杜医院,血管和肿瘤介入放射科) Department of Radiology, Hôpital Cochin, AP-HP(放射科,克里克医院,AP-HP) Centre d’Imagerie du Nord(北影像中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 ONCOPILOT是一种基于CT的可提示基础模型,通过交互式分割提升肿瘤评估精度,实现放射科医生级别的RECIST测量和体积生物标志物分析。

Journal ref npj Precis. Onc. 9, 121 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21624 2025-11-27 cs.SI cs.CL 77%

TAGFN: A Text-Attributed Graph Dataset for Fake News Detection in the Age of LLMs

TAGFN:一种用于LLMs时代虚假新闻检测的文本属性图数据集

Kay Liu, Yuwei Han, Haoyan Xu, Henry Peng Zou, Yue Zhao, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TAGFN是一种用于虚假新闻检测的文本属性图数据集,旨在评估传统和基于LLM的图异常检测方法,并促进LLMs的虚假信息检测能力发展。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20652 2025-11-27 cs.HC cs.AI cs.CY 77%

When LLMs Can't Help: Real-World Evaluation of LLMs in Nutrition

当LLM无法帮助:在营养领域的LLM实证评估

Karen Jia-Hui Li, Simone Balloccu, Ondrej Dusek, Ehud Reiter

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理学院) Saarland University(萨尔兰州大学) TU Darmstadt(图宾根大学) University of Aberdeen(阿伯丁大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究揭示了LLM在营养领域应用中的实际效果与内在评估之间的差距,指出需采用跨学科方法改进LLM的应用。

Comments Published at INLG 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20090 2025-11-27 cs.AR cs.AI 77%

R3A: Reliable RTL Repair Framework with Multi-Agent Fault Localization and Stochastic Tree-of-Thoughts Patch Generation

R3A:一种可靠的RTL修复框架,结合多智能体故障定位和随机树状思维补丁生成

Zizhang Luo, Fan Cui, Kexing Zhou, Runlin Guo, Mile Xia, Hongyuan Hou, Yun Liang

机构 * Peking University(北京大学) Beihang University(北航)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 R3A通过多智能体故障定位和随机树状思维补丁生成方法,有效提高了RTL修复的可靠性,修复率高达90.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23610 2025-11-27 cs.CL cs.CY 77%

Evaluating the Simulation of Human Personality-Driven Susceptibility to Misinformation with LLMs

评估基于人类人格驱动的易受虚假信息影响的模拟

Manuel Pratelli, Marinella Petrocchi

机构 * IMT School for Advanced Studies Lucca(IMT高级研究学院卢塞拉)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了LLM在模拟基于人格特质的易受虚假信息影响方面的有效性,发现某些人格特质与虚假信息的关联可被复制,但其他情况存在系统偏差,揭示了LLM在人格建模中的潜力与局限。

Comments pre-print version - paper actually under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21380 2025-11-27 cs.SE 75%

Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions

多智能体系统在软件工程数据集适应中的应用:能力、限制与未来方向

Jingyi Chen, Xiaoyan Guo, Songqiang Chen, Shing-Chi Cheung, Jiasi Shen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了多智能体系统在软件工程数据集适应中的能力与限制,发现提示干预能显著提升适应效果,为未来更可靠的智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19123 2025-11-27 cs.HC cs.CY 75%

Facilitating the Integration of LLMs Into Online Experiments With Simple Chat

促进LLMs融入在线实验的简易聊天

R. Bermudez Schettino, A. Dasmeh, L. Brinkmann

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Simple Chat通过简化LLMs整合流程,提升在线实验的生态效度和实验控制,助力人与LLM交互研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14914 2025-11-27 cs.CV cs.CL cs.LG 73%

CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness

CAPability: 一个全面的视觉描述基准,用于评估正确性和全面性

Zhihang Liu, Chen-Wei Xie, Bin Wen, Feiwu Yu, Jixuan Chen, Pandeng Li, Boqiang Zhang, Nianzu Yang, Yinglu Li, Zuan Gao, Yun Zheng, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CAPability是一个全面的视觉描述基准,通过12个维度评估描述的正确性和全面性,利用人类标注数据和启发式指标提升多模态模型的描述能力分析。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12422 2025-11-27 cs.LG cs.AI cs.CV 73%

CroMe: Multimodal Fake News Detection using Cross-Modal Tri-Transformer and Metric Learning

CroMe:基于跨模态三变换器和度量学习的多模态假新闻检测

Eunjee Choi, Junhyun Ahn, XinYu Piao, Jong-Kook Kim

机构 * Department of Electrical and Computer Engineering, Korea University, Seoul 02841, Republic of Korea(电气与计算机工程系,韩国大学,首尔)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CroMe通过跨模态三变换器和度量学习方法,提升多模态假新闻检测的准确性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21629 2025-11-27 cs.CL 70%

The author is dead, but what if they never lived? A reception experiment on Czech AI- and human-authored poetry

作者已故,但若他们从未活过?关于捷克AI和人类创作诗歌的接受实验

Anna Marklová, Ondřej Vinš, Martina Vokáčová, Jiří Milička

机构 * Department of Linguistics(语言学系) Institute of Czech and Deaf studies(捷克与聋人研究学院) Department of Germanic and Nordic Studies(德语与北欧研究系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了AI和人类创作捷克诗歌的可识别性及审美评价,发现AI生成的诗歌在捷克本地人中难以辨识,且受作者身份信念影响较大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21401 2025-11-27 cs.CL 70%

Can LLMs extract human-like fine-grained evidence for evidence-based fact-checking?

大语言模型能否提取出具有人类细粒度证据的证据以用于基于证据的事实核查?

Antonín Jarolím, Martin Fajčík, Lucia Makaiová

机构 * Brno University of Technology, Czech Republic(布拉格技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在细粒度证据提取任务中的表现,通过新数据集评估发现,模型大小与对齐程度之间存在有效平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19682 2025-11-27 cs.LG 70%

Deep Actor-Critics with Tight Risk Certificates

具有紧密风险证书的深度动作-评论者

Bahareh Tasdighi, Manuel Haussmann, Yi-Shan Wu, Andres R. Masegosa, Melih Kandemir

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) University of Southern Denmark(南方丹麦大学) Department of Computer Science(计算机科学系) Aalborg University(奥胡斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于递归PAC-Bayes理论的方法,用于为深度动作-评论者算法生成紧密的风险证书,以提高其在物理系统中的可靠性与实用性。

Comments updated version with new methods and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15277 2025-11-27 cs.CL 70%

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21042 2025-11-27 cs.CV 67%

LungNoduleAgent: A Collaborative Multi-Agent System for Precision Diagnosis of Lung Nodules

LungNoduleAgent: 一种用于肺结节精准诊断的协作多智能体系统

Cheng Yang, Hui Jin, Xinlei Yu, Zhipeng Wang, Yaoqun Liu, Fenglei Fan, Dajiang Lei, Gangyong Jia, Changmiao Wang, Ruiquan Ge

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 LungNoduleAgent通过协作多智能体系统提升肺结节诊断的精度与效率

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20937 2025-11-27 cs.AI cs.CL cs.CV cs.RO 62%

ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction

ENACT:通过视角交互的世界建模评估具身认知

Qineng Wang, Wenlong Huang, Yu Zhou, Hang Yin, Tianwei Bao, Jianwen Lyu, Weiyu Liu, Ruohan Zhang, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 ENACT通过视角交互的世界建模评估具身认知,揭示VLMs在长周期交互中与人类表现差距扩大,且模型在逆向任务中表现更优。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20672 2025-11-27 cs.CL cs.AI 62%

MindSET: Advancing Mental Health Benchmarking through Large-Scale Social Media Data

MindSET:通过大规模社交媒体数据推动心理健康基准测试

Saad Mankarious, Ayah Zirikly, Daniel Wiechmann, Elma Kerz, Edward Kempa, Yu Qiao

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 MindSET通过大规模社交媒体数据提升心理健康基准测试,提供超过1300万条注释帖子,显著提升诊断检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06998 2025-11-27 cs.CV cs.AI cs.LG 62%

Not All Splits Are Equal: Rethinking Attribute Generalization Across Unrelated Categories

并非所有分割都平等:重新思考跨无关类别的属性泛化

Liviu Nicolae Fircă, Antonio Bărbălau, Dan Oneata, Elena Burceanu

机构 * Bitdefender University of Bucharest(布加勒斯特大学) National University of Science and Technology Politehnica Bucharest(布加勒斯特技术科学国家大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究模型在跨无关类别间进行属性泛化的鲁棒性,通过改进的分割策略评估属性预测性能,发现聚类方法在减少相关性的同时保持学习能力,揭示了当前表示的局限性。

Comments Accepted at NeurIPS 2025 Workshop: CauScien - Uncovering Causality in Science and NeurIPS 2025 Workshop: Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏