Submitted by
dkliangTurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
TurboVLA提出了一种新的VLA范式,移除大语言模型,通过轻量级视觉-语言直接交互和紧凑的动作解码器,在RTX 4090上实现32Hz实时推理,仅0.2B参数和<1GB显存,在LIBERO上达到97.7%成功率。
Daily Papers
Submitted by
dkliangTurboVLA提出了一种新的VLA范式,移除大语言模型,通过轻量级视觉-语言直接交互和紧凑的动作解码器,在RTX 4090上实现32Hz实时推理,仅0.2B参数和<1GB显存,在LIBERO上达到97.7%成功率。
Submitted by
kuvvi提出HumanCLAW框架,将VLM的动作决策与底层执行解耦,通过原子技能和运动生成器实现闭环物理交互,并构建包含1218个长时任务episode的基准测试。测试9个尖端VLM,最佳成功率仅16.8%,失败主因是缺乏具身自我意识——不能跟踪自身身体状态、是否到达目标或碰撞障碍物。
Submitted by
jwchen2001DecoEvo通过解耦求解器与评分生成器的演化目标,在文本空间中对冻结的大语言模型进行黑盒优化,无需黄金评分即可持续提升求解器表现。
Submitted by
WaltonFutureCLBench-V 是一个多模态上下文学习基准,将能力分为三个层次:上下文定位、新信息应用和新知识学习。整合了公开和新建数据集,覆盖科学、金融、空间推理等领域。在6个模型上评测,最佳得分仅0.2847,表明多模态上下文学习远未饱和。InternVL3.5在定位和学习上最优,Qwen3.5在新信息应用上最优。
Submitted by
jwhe提出CoRT,一种基于反事实重放的Token级信用分配方法,用于基于评分标准的GRPO,无需辅助模型即可提升训练效果。
Submitted by
Wloner0809提出 CAST 方法,利用游戏求解器的状态值变化作为逐回合信用信号,将其注入强化学习以训练 LLM 游戏智能体,在多个游戏中取得最优性能。
Submitted by
LZXzjuSkillRise提出了一种统一的强化学习框架,通过将相关任务组织成渐进序列,让单个策略交替进行任务解决和技能文档整理,并采用解耦的跨任务信用分配来优化,从而在多个任务间高效地学习和复用可迁移技能。
Submitted by
taesiriOmegaUse-OfficeVal是一个包含100个长周期办公任务的基准,每个任务提供人工劳动时间和价格代理两个经济信号,用于评估LLM代理的交付物质量,并支持成本与价值加权分析。
Submitted by
taesiri通过“影子评估”测试前沿AI智能体在开放式AI研究中的表现,发现它们能完成工程任务但无法解决核心研究问题,暴露出五大失败模式。
Submitted by
kyujinpy本文提出TriLayer数据集和DBL-Diffusion框架,通过显式的前景层监督实现视频物体插入和层分解,显著提升合成质量和分解精度。
Submitted by
taesiriGPT-Red 是一个通过自对弈训练的大规模自动红队代理,专门用于发现针对前沿 LLM 的提示注入攻击,并用于对抗训练 GPT-5.6 以提高鲁棒性。
Submitted by
0xmooseStealthBench是一个用于衡量自主攻防安全代理操作隐蔽性的基准,发现当前代理在六种OPSEC维度上普遍存在隐蔽缺陷,最高安全成功率仅54%。
Submitted by
alizahidraja本文提出ISNAD框架,将伊斯兰圣训学中的传述链(isnad)和传述者评级(rijal)方法迁移到多智能体知识系统中,为每一条知识主张提供完整的传述链和每个传述者的可靠性评级,支持最弱环节检疫、独立链佐证以及内容批评与链质量的决策矩阵。在2万条物理教材主张上验证了最弱环节检疫和独立链佐证的有效性,但评级恢复循环部分失败,漏掉了错误率最高的传述者。
Submitted by
bcol提出首个后妥协事件响应基准SecRespond,评估LLM代理在真实磁盘快照和警报上的表现,发现现有代理能处理警报但无法主动发现静默入侵或生成全面修复计划。