Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading Paper • 2607.08964 • Published Jul 9 • 79
ShadowPEFT: Shadow Network for Parameter-Efficient Fine-Tuning Paper • 2604.19254 • Published Apr 21 • 32
Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning Paper • 2605.14386 • Published May 14 • 54
Training Numerical Intelligence via Auto-Diagnosis and Skill Discovery Paper • 2610.03872 • Published 9 days ago • 10
PerturBot: Breaking Shortcut Priors in Vision-Language-Action Models with Perturbative Training Paper • 2610.04616 • Published 8 days ago • 20
UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents Paper • 2610.05622 • Published 7 days ago • 22
Self-Supervised Scaling of Terminal Environments for Scientific Domains Paper • 2610.02710 • Published 9 days ago • 13
Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering Paper • 2610.05894 • Published 6 days ago • 17
From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation Paper • 2610.02179 • Published 10 days ago • 20
Learning from Runtime Feedback through Failure-Bank Self-Evolution for Vision-Language-Action Models Paper • 2609.39820 • Published 11 days ago • 30
Skill2Real: Agentic Skill Learning for Zero-Shot Sim-to-Real Robot Manipulation Paper • 2610.02788 • Published 9 days ago • 18
Equal Ranking Quality, Different Decisions: Measuring and Reducing Order Dependence in LLM Scorers Paper • 2608.26762 • Published 15 days ago • 23
WEFT: Scaling Tool-Use Post-Training for General-Purpose Agents Paper • 2609.36887 • Published 12 days ago • 26
FrugalEvo: Towards Cost-Aware LLM-Guided Program Evolution Paper • 2610.03675 • Published 9 days ago • 29
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning Paper • 2610.02824 • Published 9 days ago • 33
4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes Paper • 2610.03715 • Published 9 days ago • 32
Beyond Future Prediction: Denoising as Generative Adaptation for Robot Control Paper • 2609.28339 • Published 18 days ago • 30