Daily Papers

Daily Papers

Newer
Sep 28, 2026 14 papers
Older
FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders
HO

Submitted by

Hongyang-Du
67

Du, Hongyang · 16 authors

FuseReg 提出用「随机层子集融合」代替人工挑选固定的编码器层融合:训练时随机采样若干编码器层并做归一化融合,让解码器和扩散生成器学会在多种层组合下都工作。这样既缓解了「浅层利于重建、深层利于生成」的重建—生成鸿沟,又无需改动预训练编码器。在 ImageNet-256 + DINOv3-L 上,单个 FuseReg 解码器可同时支持全层/稀疏/单层融合且 PSNR 高于固定融合专用解码器;仅替换解码器即可让 RAEv2 DiT-XL 的 unguided gFID 降低 27%,两阶段联合正则在...

#01 ↑ 67 upvotes 2609.31620 Sep 28, 2026
InternW0-$\Delta$: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data
TA

Submitted by

taesiri
17

Miao, Xingyu · 48 authors

InternW0-Δ 是一个统一的世界动作模型:在超 2 万小时异构机器人/人类数据上预训练,用有向 Mixture-of-Transformers 耦合视频专家与动作专家,并借助冻结 VLM 语义、Causal Imprint 和训练期 4D 蒸馏,把预测动力学转成动作可用表示;推理时无需生成未来视频,在多个仿真基准和真实机器人平台上取得领先。

#02 ↑ 17 upvotes 2609.31394 Sep 28, 2026
RayOrch: Programming and Executing Lineage-Controlled Multi-Grain Dataflows for Foundation-Model Data Preparation
SU

Submitted by

Sunnyhaze
17

Ma, Xiaochen · 16 authors

RayOrch 是一个面向基础模型数据准备的编程模型与分布式执行引擎,核心是在跨父项批处理子项时仍保留父子血缘、子项顺序、完成状态与结果路由;程序声明“可变基数展开”和“匹配的汇聚”,运行时用逐调用 FIFO 就绪队列调度,按成员关系与序号重建父结果,并支持父级作用域失败隔离。

#03 ↑ 17 upvotes 2609.18703 Sep 28, 2026
Block Sparse Attention with Log-Linear Complexity
AP

Submitted by

Aphelios-Tang
14

Tang, Bohao · 5 authors

PISA 是一种块稀疏注意力机制,用金字塔式由粗到细的 Top-K 选择替代对所有 query-block 对打分,使块选择本身从二次复杂度降为 O(N log N),并配套训练/推理可用的 Triton 内核。

#04 ↑ 14 upvotes 2609.31093 Sep 28, 2026
FoMo: Forking Moment in Generative Trajectory as a Perceptual Distance
JH

Submitted by

JHLew
6

Lew, Jaihyun · 5 authors

论文提出 FoMo:把扩散生成轨迹中的“分叉时刻”作为参考锚定的逐点感知距离标签,无需人工标注来训练参考型图像质量评价(IQA)指标。其假设是分叉越早,图像只共享粗结构,感知差异越大;分叉越晚,差异仅限细节,感知距离越小。摘要声称该方法在多个基准和多种骨干网络上优于人工标注数据集。

#05 ↑ 6 upvotes 2609.25716 Sep 28, 2026
Jev in the Wild: A Data-Driven Analysis of the Jev Model's Functionality, Applications and Ecosystem
LI

Submitted by

linggm
5

Ling, Guoming, Xue, Muen, Ye, Zijian

论文对截至 2026-09-22 从 GitHub 收集的 2,170 个公开 Jev 项目做大规模数据驱动分析,量化其生态增长、应用领域、决策用途与接口使用,并比较项目分布和公众关注。核心结论:Jev 是快速、低成本的可复用决策组件,属性判断与打分使用最广,公众关注集中在路由和接口代理而非项目数量。注意:所给内容在 2.1 节后截断,后续方法细节与完整结果不可见。

#06 ↑ 5 upvotes 2609.30216 Sep 28, 2026
SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
YA

Submitted by

YanZhanPKU
5

Zhan, Yan · 10 authors

SLCA-GRPO 针对工具调用智能体输出中“工具调用/推理轨迹”与“自然语言总结”异质分段,指出 GRPO 等把轨迹级标量优势广播给所有 token 会导致跨分段信用错配。它提出 Segment-Locked Credit Assignment,把工具段优势只路由给工具 token、总结段优势只路由给总结 token,并配合 SGLS 模拟器与 HierR 分层奖励,在同一组 rollout 内完成分段优势估计。7B 上相比 GRPO/ToolPO/RLTR 在域内、BFCL、τ²-Bench 分别报告...

#07 ↑ 5 upvotes 2609.29050 Sep 28, 2026
TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations
AY

Submitted by

ayushjain1144
5

Jain, Ayush · 8 authors

TrackEverything 是一种 3D 点跟踪器,将视频表示为世界坐标系中的持久 3D 场景轨迹,通过体素化去重让复杂度随独特物理几何而非帧数增长,从而在 40GB GPU 内对超过 1000 帧视频跟踪所有可见点。

#08 ↑ 5 upvotes 2609.30222 Sep 28, 2026
Game Arena: Strategic LLM Evaluation in Competitive Environments
TA

Submitted by

taesiri
4

Doerschuk-Tiberi, Bovard · 62 authors

Kaggle Game Arena 是一个开放、可扩展的 LLM 竞技评估平台:让模型在 Chess、Poker、Werewolf 等结构化游戏中头对头对局,用胜负/筹码等客观结果和统计置信区间构建排行榜,以缓解静态基准饱和、数据污染和主观评审噪声。该技术报告主要介绍基础设施、三个 pilot 环境与评测方法;所给内容未包含完整实验结果。

#09 ↑ 4 upvotes 2609.31473 Sep 28, 2026
AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs
TA

Submitted by

taesiri
3

Shu, Raphael · 10 authors

AgentWorld 是一个面向多智能体 LLM 长时程协作的基准:它基于开源的 MMORPG 沙盒(Kaetram)构建,包含 100 个人工标注任务及 100 个 LLM 增强变体,任务需要 3–20 个具有不对称角色的智能体在 25–55 轮(摘要称 50+ 轮)内通过通信、联合规划与资源共享完成,且采用黑盒设定(智能体看不到彼此内部状态)。除了二元的任务成功率,论文提出基于动作因果图的 Causal Collaboration...

#10 ↑ 3 upvotes 2609.31590 Sep 28, 2026
CARD: Cluster-level Adaptation with Reward-guided Decoding for Personalized Text Generation
HU

Submitted by

hulehule
3

Song, Yutong · 10 authors

CARD 是一个分层个性化文本生成框架:先按用户画像聚类并为每簇训练共享 LoRA,作为组级风格先验;再用“用户真实文本 vs 同簇 LoRA 生成文本”构造隐式偏好对,学习轻量用户偏好向量;推理时保持主干和簇 LoRA 冻结,仅在解码阶段通过用户向量和低秩 logit 修正注入个性化。摘要声称在 LaMP 和 LongLaMP 上生成质量优于基线并显著提升效率与可扩展性,但所给内容在 2.4 节后截断,缺少实验细节,因此具体增益无法从当前文本核验。

#11 ↑ 3 upvotes 2601.06352 Sep 28, 2026
Do Implicit Personalization and Explicit Styles Conflict? PsPLUG: A Lightweight Plug-in for Balancing Personalization and Style in Customized LLMs
HU

Submitted by

hulehule
2

Song, Yutong · 8 authors

论文指出现有个性化LLM在显式风格指令下会出现“个性化坍缩”,即风格控制与隐式用户偏好冲突。作者提出PsPLUG:把个性化建模为用户分布相对基座模型中性分布的残差,用轻量软提示插件和风格条件偏好目标学习用户特有信号,并可在推理时调节个性化强度。摘要声称在LaMP基准上优于现有方法。注意:提供的正文在方法部分被截断,实验细节和完整方法未给出。

#12 ↑ 2 upvotes 2601.06362 Sep 28, 2026
ZooWork-ShopRanker: An Open, Preference-Aligned E-Commerce Reranker
GE

Submitted by

Geralt-Targaryen
2

Xue, Siqiao, Liu, Shuxuan, Hu, Ning

论文提出 ZooWork-ShopRanker,一个面向电商重排的开源偏好对齐模型族(0.6B、4B、8B)。它用多家族推理 LLM 作为偏好裁判,经双向判题和一致度分层生成偏好对,先训练 8B 旗舰,再蒸馏到 4B/0.6B。作者还发布 ShopRank-Bench:约 1 万条私有搜索流量偏好对,含结构化与自然语言两种格式。8B/4B 显著超过最强开源重排基线,各模型均显著超过自身未对齐版本,0.6B 超过同尺寸同行;增益在两种格式和常见 MTEB 任务上成立。

#13 ↑ 2 upvotes 2609.31002 Sep 28, 2026
Morphometric Imitation: From Morphology and Contact Aware Hand Retargeting to Sim-to-Real Visuomotor Policy
TS

Submitted by

tsadja
1

Sadjadpour, Tara · 8 authors

Morphometric Imitation 是一个三阶段框架:先用形态与接触感知的运动学重定向(MMO)把人类手物交互迁移到不同机械手,再用残差强化学习生成动力学可行的演示,最后蒸馏为零样本 sim-to-real 视觉运动策略。摘要报告三只机械手、十个 GRAB 交互上接触 F1 至少提升 8 点,动态重定向成功率最多提升 35 点,真机 300 次试验零样本成功率 89.3%。

#14 ↑ 1 upvotes 2609.28660 Sep 28, 2026