COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization Paper • 2609.11682 • Published 6 days ago • 35
Diffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models Paper • 2609.05779 • Published 11 days ago • 11
AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems Paper • 2609.08572 • Published 8 days ago • 94
An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics Paper • 2609.10712 • Published 7 days ago • 40
SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem Paper • 2609.07064 • Published 9 days ago • 136
EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents Paper • 2609.05903 • Published 11 days ago • 61
Revisiting Complete Reasoning Traces for Post-Training Paper • 2609.07103 • Published 9 days ago • 23
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness Paper • 2609.08183 • Published 8 days ago • 414
When Models Edit Too Much: On the Fidelity of Minimal Code Edits Paper • 2609.04061 • Published 13 days ago • 10
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems Paper • 2609.02750 • Published 14 days ago • 146
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 13 days ago • 184
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 13 days ago • 97
PaperCompiler: Faithful Paper-to-Code Generation via Repository-Level Specification Compilation Paper • 2609.02272 • Published 14 days ago • 7
S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? Paper • 2608.31100 • Published 16 days ago • 40
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? Paper • 2609.01437 • Published 15 days ago • 268
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction Paper • 2609.02783 • Published 14 days ago • 120