arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Georgia Institute of Technology(佐治亚理工学院)

2026-08-28 至 2026-08-28 共收录 4
2607.19326 2026-08-28 cs.CL 版本更新

Selective State-Space Adaptation and Retrieval for Language Model Reasoning

用于语言模型推理的选择性状态空间适应与检索

Atahan Dokme, Larry Heck

机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对语言模型推理,提出一类含MaLoRA和MaRA的适配器,通过在令牌和上下文级别引入选择性状态空间递归实现适应,在多个冻结主干和推理基准上提升了推理准确性。

Comments Accepted to EMNLP 2026 (Main Conference). 22 pages, 5 figures, 20 tables. Code: this https URL (https://github.com/atahandokme/malora-mara)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-08-28 cs.CL 版本更新

Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20650 2026-08-28 cs.CV 版本更新

OS-Marathon: Benchmarking Computer-Use Agents on Vast-Horizon, Repetitive Tasks

OS-Marathon: 在长周期重复任务上评估计算机使用代理的基准测试

Jing Wu, Wenjie Ai, Daphne Barretto, Yiye Chen, Qingyu Chen, Yuhang He, Pranit Chawla, Nicholas Gydé, Yanan Jian, Vibhav Vineet

机构 * University of Oxford(牛津大学) Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院)

AI总结 OS-Marathon通过建立长周期重复任务的基准测试,评估计算机使用代理在处理复杂工作流中的性能和有效性。

Comments EMNLP 2026 Main Conference, Project Page: this https URL (https://os-marathon.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08143 2026-08-28 cs.HC cs.AI 版本更新

Communication styles and reader preferences of LLM- and human-authored COVID-19 information explanations: a case study

由大语言模型(LLM)与人类撰写的新冠疫情信息解释的沟通风格及读者偏好:一项案例研究

Jiawei Zhou, Kritika Venkatachalam, Minje Choi, Koustuv Saha, Munmun De Choudhury

机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) Amazon(亚马逊) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(Siebel计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究以健康事实核查为场景,对比LLM与人类新冠信息解释的沟通风格,发现LLM内容在说服性等质量指标上较弱但受读者偏好,揭示LLM在健康领域的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏