arXivarxivBoosting LLM Exploration via Weak-Model Guidance in RLVRarxivcs.CLpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivConsolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigmsarxivcs.CLpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivDiffusion Policies for Short-Horizon Planning in Robot Crowd Navigationarxivcs.LGpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivGRAIN: Bridging Name and Narrative Shifts in Real-World Graph Reasoning through Invariance-Rewarded Agentic RLarxivcs.AIpublisher:arxiv3 days ago▲ 43Read story→
arXivarxiv$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learningarxivcs.ROcs.AI4 days ago▲ 43Read story→