arXivarxivBoosting LLM Exploration via Weak-Model Guidance in RLVRarxivcs.CLpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivConsolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigmsarxivcs.CLpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivDiffusion Policies for Short-Horizon Planning in Robot Crowd Navigationarxivcs.LGpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivGRAIN: Bridging Name and Narrative Shifts in Real-World Graph Reasoning through Invariance-Rewarded Agentic RLarxivcs.AIpublisher:arxiv4 days ago▲ 43Read story→
arXivarxiv$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learningarxivcs.ROcs.AI4 days ago▲ 43Read story→
arXivarxivOne Symptom, Three Levers: A Critical Review of On-Policy Self-Distillationarxivcs.LGcs.AI4 days ago▲ 43Read story→
arXivarxivSPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RLarxivcs.AIpublisher:arxiv5 days ago▲ 43Read story→
arXivarxivImproving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglementarxivcs.LGpublisher:arxiv5 days ago▲ 43Read story→
arXivarxivBellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learningarxivcs.LGstat.ML5 days ago▲ 43Read story→
arXivarxivRe$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learningarxivcs.CVcs.AI9 days ago▲ 43Read story→
arXivarxivLearning When to Think: Adaptive Reasoning for Test-Time Compute Allocationarxivcs.AIpublisher:arxiv10 days ago▲ 43Read story→