arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2607.25700 2026-07-29 cs.HC 新提交 83%

BioDisclose: An Actionability-Aware Benchmark for Biomedical Safety under Adversarial Elicitation

BioDisclose:对抗性诱导下生物医学安全的可操作性感知基准

Yinuo Zhu, He Liu, Boyuan Gu

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型在对抗性诱导下生物医学知识披露行为不足问题,引入BioDisclose基准,含多领域多类别提示,对模型响应四级评分,通过实验揭示不同模型、策略及风险类别差异,为评估生物医学安全提供新测试平台。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17211 2026-07-21 cs.SE 新提交 83%

Prefactory: Automated Discovery and Application of Library-Adoption Refactorings

Prefactory:库采用重构的自动发现与应用

Islem Bouzenia, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 研究如何自动进行库采用重构。核心方法是用 LLM 合成搜索启发式方法,收集元数据和词汇生成检测器找候选函数,排序后用 LLM 生成重构并验证。主要贡献是在 PrefactoryBench 上表现优于基线,产生多个经测试验证的重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09007 2026-07-13 cs.SE quant-ph 新提交 83%

Benchmarking Large Language Models on Repairing Qiskit Programs using Bugs4Q

使用 Bugs4Q 对修复 Qiskit 程序的大语言模型进行基准测试

Saumya Brahmbhatt, Mitali Hukkeri, Dongchan Kim, M. V. Panduranga Rao, Lei Zhang

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 研究使用 Bugs4Q 对修复 Qiskit 程序的大语言模型进行基准测试,评估两个含 67 个缺陷的 Bugs4Q 版本,在六个 Qiskit 版本上测试四个大语言模型,发现问题并发布重新验证的基准测试,强调基准验证先于修复评估。

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05785 2026-07-08 cs.SE 新提交 83%

Can Large Language Models Generate Observability-Aware Code?

大语言模型能否生成可观测性感知代码?

Yongliang Tao, Hongyu Zhang, Pengfei Gao, Minghua Ma, Zhiyu Fan, Yu Kang, Jue Zhang, Si Qin, Liqun Li, Qingwei Lin, Saravan Rajmohan

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 研究大语言模型生成的代码在可观测性方面的表现,通过恢复工件和注入故障评估代理生成系统的源级诊断语义与运行时故障信号,发现两者存在差距,引入的技能改进有限,指出当前评估或忽视可观测性这一软件质量维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04558 2026-07-07 cs.CL cs.AI cs.LG 新提交 83%

EEG-SpikeAgent: Agentic Closed-Loop Program Synthesis for Automated EEG Spike Detection

EEG-SpikeAgent:用于自动脑电图尖峰检测的智能闭环程序合成

Sonali Santhosh, Kelly Shuhong Yu, Eugene Chang, Jonathan Kim, Kie Shidara, Danilo Bernardo

机构 * Dept. of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑科学与认知科学系,麻省理工学院) Dept. of Neuroscience, University of California, Berkeley(神经科学系,加州大学伯克利分校) Dept. of Neurology and Neurologic Sciences, Stanford University(神经病学与神经科学系,斯坦福大学) Weill Institute of Neurology and Neurosciences, University of California, San Francisco(Weill神经医学研究所,加州大学旧金山分校) University of California, San Francisco(加州大学旧金山分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用大语言模型智能系统,为头皮脑电图尖峰检测生成信号处理特征。核心方法是迭代提出特征模块并执行代码生成表格特征,评估性能后反馈优化。贡献是实现可审核的脑电图特征工程自动化。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02642 2026-07-07 cs.RO 新提交 83%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22005 2026-07-07 cs.SD 新提交 83%

InstructFX2FX: A Multi-Turn Text-to-Effect System for Sequential Audio Effect Refinement

InstructFX2FX: 用于迭代音频效果优化的多轮文本到预设演示

Song-Ze Yu, Milan Liessens Dujardin, Yuxuan Cai, Wantong Zhang, Brian Cruz, Jeremy Wagner, Carmine-Emanuele Cella

机构 * Center for New Music and Audio Technologies (CNMAT)(新音乐与音频技术中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出InstructFX2FX,一种多轮文本引导的音频效果优化演示,结合语言模型和CLAP引导优化,实现迭代效果调整,相比纯LLM重提示基线将平均MMD降低约24%。

Comments Accepted to DAFx26. Audio demos and source code: https://instructfx2fx.vaclis.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01647 2026-07-03 cs.DB cs.AI cs.CL cs.LG 新提交 83%

AgenticDataBench: A Comprehensive Benchmark for Data Agents

AgenticDataBench:数据智能体的综合基准

Zhaoyan Sun, Shan Zhong, Daizhou Wen, Jiaxing Han, Guoliang Li, Ying Yan, Peng Zhang, Yu Su, Xiang Qi, Baolin Sun, Chengyuan Yang, Tao Fang, Huaiyu Ruan

机构 * Tsinghua University(清华大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AgenticDataBench基准,通过覆盖15个垂直领域(含5个真实B2B用例)的细粒度任务,评估基于大语言模型的数据智能体在自动化数据科学工作流中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01245 2026-07-03 cs.CL cs.AI cs.CY cs.IR cs.LG 新提交 83%

Office Comprehension Benchmark

办公室理解基准

Firoz Shaik, Mateus Picanço Lima Gomes, Tanvir Aumi, Jingci Wang, Milos Milunovic, Filip Basara, Ivana Jovanovic, Vishwas Suryanarayanan, Neha Nandan Kenkare, Weiyao Xie, Zhipeng Han, Zheng Zhang, Waleed Shahid, Jay Rathi, Russell Scherer, Thong Q. Nguyen, Michael Bentley, Tamara Stankovic, Rasika Chakravarthy, Vishal Chowdhary

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Office Comprehension Bench,首个联合评估LLM对Word Excel和PowerPoint文件理解的基准,包含文件保真度问答和领域问答两个赛道,测试结构与视觉感知及多领域推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00304 2026-07-02 cs.LG cs.AI cs.CL 新提交 83%

Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions

映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查

Zewen Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31213 2026-07-01 cs.CL cs.AI cs.LG 新提交 83%

Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

LLMs能否想象超越二元困境的道德替代方案?

Jongchan Choi, Nari Yang, Sung Soo Park, Jaemin Cho, Han Seoyoung, Haerin Shin, Jun-Hyung Park

机构 * Korea University(高丽大学) XenoStep AI Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLMs在道德困境中缺乏替代方案想象能力的问题,提出MoralAltDataset数据集,通过引入妥协和重构替代方案,发现LLMs倾向于选择替代方案,且生成的替代方案在质量和伦理标准上优于人类。

Comments "23 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30810 2026-07-01 cs.SE 新提交 83%

Towards Knowledge Alignment in Code LLMs: Contrastive Unlearning for Evolving APIs

面向代码大语言模型的知识对齐:针对演化API的对比性遗忘

Huy Q. Tran, Dang H. Vu, Tuyen N. Dinh, Anh H. D. Nguyen, Anh N. H. Vu, Anh M. T. Bui, Phuong T. Nguyen

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出对比性遗忘方法CURE,在抑制废弃API的同时鼓励正确替代,使代码LLM适应演化库,实验表明该方法优于现有基线。

Comments The paper has been peer reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24819 2026-06-24 cs.CR 新提交 83%

HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice

HelpBench:评估LLM提供隐私、安全和安全建议的能力

Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出HelpBench基准,通过450个真实用户问题评估18个LLM的隐私、安全建议准确性,发现平均得分82%但10%回答低于65%存在有害建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17789 2026-06-17 cs.HC 新提交 83%

Mind Companion: An Embodied Conversational Agent for Process-Based Psychotherapy

Mind Companion: 一种用于基于过程心理治疗的具身对话代理

Sofie Kamber, Lukas Diebold, Pascal Riachi, Stella Brogna, Andrew Gloster, Rafael Wampfler

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Mind Companion,一种基于大语言模型的具身对话代理,通过多层级心理分析与过程治疗原则,实时分析客户陈述并生成回应,评估显示GPT-5.2在多个维度上优于人类治疗师。

Journal ref 2026 IEEE 14th International Conference on Healthcare Informatics (ICHI), Minneapolis, MN, June 1-3, 2026, pp. 980-989

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16753 2026-06-16 cs.CL cs.AI cs.LG 新提交 83%

P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs

P3B3:用于测量大语言模型中欧洲和巴西葡萄牙语变体偏差的多轮对话基准

Rafael Ferreira, Inês Vieira, Inês Calvo, James Furtado, Iago Paulo, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

机构 * NOVA University of Lisbon(新里斯本大学) NOVA LINCS(NOVA LINCS实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出P3B3基准,通过专家策划的对话提示和评估框架,测量大语言模型在葡萄牙语变体(欧洲vs巴西)上的偏差和可控性,发现多数模型偏向巴西葡萄牙语。

Comments Accepted at MeLLM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15390 2026-06-16 cs.CL cs.AI cs.LG 新提交 83%

Not All Skills Help: Measuring and Repairing Agent Knowledge

并非所有技能都有用:测量与修复智能体知识

Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Purdue(普渡大学) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASSAY框架,通过随机掩码测量技能因果贡献,分离技能生成与筛选,在推理时抑制负面技能,显著提升LLM智能体任务完成率。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11459 2026-06-11 cs.CL cs.AI cs.LG 新提交 83%

APEX: Automated Prompt Engineering eXpert with Dynamic Data Selection

APEX: 具有动态数据选择的自动提示工程专家

Fei Wang, Si Si, Cho-Jui Hsieh, Inderjit S. Dhillon

机构 * Google(谷歌) UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出APEX框架,通过动态数据分层(易、难、混合)优先选择高杠杆子集,在固定预算下提升提示优化效率,在三个基准上平均提升11.2%和6.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09890 2026-06-10 cs.LG cs.AI cs.CL 新提交 83%

PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

PreAct-Bench:大语言模型中的预测性监控基准

Hainiu Xu, Italo Luis da Silva, Jiangnan Ye, Yuhao Wang, Wei Liu, Linyi Yang, Jonathan Richard Schwarz, Nicola Paoletti, Yulan He, Hanqi Yan

机构 * King’s College London(伦敦国王学院) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) Thomson Reuters Foundational Research(汤姆森路透基础研究) Imperial College London(伦敦帝国学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出预测性监控任务,在动作执行前判断是否会导致不道德行为,并构建PreActBench基准,评估多种模型发现该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08345 2026-06-09 cs.CE 新提交 83%

AuditFraudBench: Benchmarking Audit Judgment in Detecting Fraudulent Misstatements

AuditFraudBench:检测欺诈性错报的审计判断基准

Zhiwei Liu, Yueru He, Qing Ou, Tianlei Zhu, Xiaorui Guo, Xueqing Peng, Sophia Ananiadou

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出AuditFraudBench基准,包含利润来源归因、误导性叙述检测和欺诈模式分类三个任务,评估LLM在审计场景中识别财务欺诈的能力,发现现有模型在联合推理财务数据与披露框架方面存在困难。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21208 2026-08-24 cs.SE cs.AI cs.LO 新提交 83%

Specification Portability Across LLM Development Agents: Cross-Agent Compatibility in Specification-Driven Software Migration

跨大语言模型开发智能体的规范可移植性:规范驱动软件迁移中的跨智能体兼容性

Oleg Grynets, Oleksii Ilchuk, Dariia Zatulna, Vasyl Lyashkevych

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文以Oracle到PostgreSQL的软件迁移为任务,评估了Amazon Kiro等多个LLM开发智能体在规范驱动迁移中的表现,发现跨智能体迁移存在性能下降,提出需重视规范可移植性等问题。

Comments 11 pages, 4 figures, 7 tables, 27 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21097 2026-08-24 cs.AI 新提交 83%

When Trust Meets Truth: Trust-Truth Separability in LLM-as-Judge

当信任遭遇真相:大模型作为评判者中的信任-真相可分性

Xin Sun, Di Wu, Yuchen Guo, Jiahuan Pei, Isao Echizen, Abdallah El Ali, Saku Sugawara

机构 * National Institute of Informatics (NII)(信息学研究所(NII)) University of Amsterdam(阿姆斯特丹大学) University of Tokyo(东京大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Centrum Wiskunde & Informatica (CWI)(数学和计算机科学中心(CWI)) Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究针对大模型作为评判者系统,发现其信任评分与真相判决的分离性弱于人类,来源线索会同时影响信任评分与真相判决,因此不应将信任评分视为真相判断的独立证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18433 2026-08-20 cs.RO cs.LG 新提交 83%

The Embodiment Gap in Robot Foundation Models

机器人基础模型中的具身差距

Yukiyasu Domae, Keisuke Shirai, Hanbit Oh, Ryoichi Nakajo, Tomohiro Motoda, Koshi Makihara, Masaki Murooka, Takuma Yagi, Yoshiaki Bando, Ryo Hanai

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究院(AIST))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本综述定义机器人基础模型的具身差距,通过双轴图分类方法,从三个研究方向考察近期工作,提出报告框架以助力跨具身学习的评估与未来研究。

Comments 32 pages, 4 figures. Published in Transactions on Machine Learning Research (TMLR), August 2026

Journal ref Transactions on Machine Learning Research, August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16210 2026-08-18 cs.LG stat.ML 新提交 83%

Conditional Evaluation of Language Models with Cheap Auxiliary Signals

基于廉价辅助信号的语言模型条件评估

Zhi Zhang, Lingfeng Lyu, Yue Kang, Doudou Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Science and Technology of China(中国科学技术大学) Microsoft(微软公司) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对现有语言模型条件评估中廉价辅助信号存在偏差的问题,提出半监督估计器LACE,结合局部中心化与岭控制变量,在多个基准数据集上完成实证评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14694 2026-08-18 cs.AI cs.NI eess.SP 新提交 83%

A Comprehensive Survey of Wireless Foundation Models for AI-Native 6G Networks

面向AI原生6G网络的无线基础模型综合综述

Naveed Khan, Besan Al Sbeihi, Maryam Alshehhi, Nasir Saeed

机构 * College of Engineering, United Arab Emirates University(阿联酋大学工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该综述针对无线基础模型(WFMs)的设计、学习与部署展开统一梳理,明确其概念与分类,综述相关架构、方法及应用,分析关键挑战并展望未来方向,为AI原生6G网络智能系统研发提供参考。

Comments 28 Pages, submitted to IEEE Communications Surveys and Tutorials

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交 83%

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11408 2026-08-13 cs.CL 新提交 83%

Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning

测量,而非优化:预测大语言模型遗忘中的恢复情况

Zirui Song, Huaxing Liu, Xiang Wang, Shuai Li, Xinye Li, Lang Gao, Jinghui Zhang, Zheng Lu, Fengxian Ji, Xiaojun Chang, Xiuying Chen

机构 * AMAP, Alibaba Group(阿里巴巴集团 AMAP)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出推理时审计方法J-Access,对398个采用8种遗忘方法的公开模型审计后发现,J-Access可评估模型残留知识恢复易感性,直接最小化J-Access无法促进真正删除,内部审计不应随意转为优化目标。

Comments In processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09937 2026-08-12 cs.CL cs.CY 新提交 83%

Carefully Considering Culture: Analyzing LLM Alignment in Single- and Multi-Cultural Settings using Cultural Consensus Theory

仔细考量文化:利用文化共识理论分析单文化与多文化场景下的大语言模型对齐

Krishna Pothugunta, John P. Lalor

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究利用文化共识理论,分析大语言模型在单/多文化场景下的对齐情况,发现模型存在文化结构误表征问题,该理论可用于区分模型反映人类多样性与算法同质化的情况。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09285 2026-08-11 eess.SP cs.AI 新提交 83%

GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization

GLocFM:面向三维室内无线定位的几何感知基础模型

Chenghong Bian, Chaozheng Wen, Hongze Chen, Jun Zhang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。

Comments 13 pages, single column

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08227 2026-08-11 cs.CL cs.HC 新提交 83%

Focus particles and scalar inferences across humans and language models

人类与语言模型的焦点小品词及标量推理

Catherine M. Brousse, Nelu D. Radpour

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究测试人类与大型语言模型能否从含焦点小品词的句子构建稳定标量表征,发现二者相似输出或源于不同底层机制。

Comments 3 pages, 1 figure, presented at 9th annual Conference on Cognitive Computational Neuroscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07631 2026-08-11 cs.SD cs.AI cs.MM 新提交 83%

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

PACE:面向基于大语言模型的全双工语音对话的播放对齐上下文引擎

Shibo Wang, Zicheng Zhang, Libo Wang, Junfeng Ma

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究针对全双工语音对话的生成上下文错位问题,提出了中间件层PACE,通过将模型上下文锚定到客户端播放边界解决该问题,在GCM-Bench等数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏