arXivarxivDesigner-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Designarxivcs.AIcs.CV3 days ago▲ 43Read story→
arXivarxivCross-sector generalization of accident-process role classification in occupational accident narrativesarxivcs.CLpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivCodeMidas: Scaling Agentic Coding RL Environments from Code Itselfarxivcs.AIpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivValue-Sensitive Delegation in Everyday AI Agent Use: Evidence from OpenClawarxivcs.HCcs.AI3 days ago▲ 43Read story→
arXivarxivBrainWideBench: Benchmarking large-scale pretraining and across-animal transfer in multi-region neural recordingsarxivcs.LGq-bio.NC3 days ago▲ 43Read story→
arXivarxivPredictable Failure in Multi-Hop Retrieval: Score-Distributional Confidence Scoring and Abstentionarxivcs.IRcs.CL3 days ago▲ 43Read story→
arXivarxivBenchmarking World Models for Continual Learning on Compositional Tasksarxivcs.LGcs.RO3 days ago▲ 43Read story→
arXivarxivParticle Competition and Cooperation for Robust Graph Convolutional Network Learning Under Label Noisearxivcs.LGpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivAvailable Guardrails: Certifying Selective Prediction across ML Systemsarxivcs.LGpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivAn Interpretable Memory Decision Controller for LLM Agents Based on Three-Signal Complementarity: Decoupling Confidence and Consistencyarxivcs.CLpublisher:arxiv3 days ago▲ 43Read story→
arXivarxiv$λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resourcearxivcs.LGpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivGricea: An Open Science Platform for Conversational AI Researcharxivcs.HCcs.AI3 days ago▲ 43Read story→
arXivarxivQuranicMMLU: A Cognitively-Aware Benchmark for Evaluating Generative AI Solutions on Quranic Linguistic Knowledgearxivcs.CLpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivCOMPLEX: A Closed-Form Certified Embedding of Multiparameter Persistence Modulesarxivcs.LGmath.AT3 days ago▲ 43Read story→
arXivarxivDiaVLo: Diagnosing Behaviours of Vision-Language Modelsarxivcs.CLcs.AI3 days ago▲ 43Read story→
arXivarxivAbstention and Noise Filtering: Two Missing Primitives of Softmax Attentionarxivcs.LGcs.CL3 days ago▲ 43Read story→
arXivarxivRecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agentsarxivcs.CLcs.SE3 days ago▲ 43Read story→
arXivarxivBayesian Belief Layer for Controllable Opinion Dynamics in LLM Agentsarxivcs.MAcs.AI3 days ago▲ 43Read story→
arXivarxivA Lie Detector Test for Language Models: Reading Knowledge a Model Won't Revealarxivcs.AIpublisher:arxiv3 days ago▲ 43Read story→
arXivarxivAssessment of Machine Learning-Based Critical Heat Flux Models in the CTF Subchannel Code for Square Rod Bundle Predictionarxivcs.LGpublisher:arxiv3 days ago▲ 43Read story→