arXivarxivWhen Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMsarxivcs.LGpublisher:arxiv28 days ago▲ 43Read story→
arXivarxivA Statistical Audit of Physical AI Benchmark Redundancyarxivcs.ROcs.AI28 days ago▲ 43Read story→
arXivarxivCandidate supply and answer selection shape the value of LLM judging in multi-agent systemsarxivcs.AIcs.MA28 days ago▲ 43Read story→
arXivarxivOne Symptom, Three Levers: A Critical Review of On-Policy Self-Distillationarxivcs.LGcs.AI28 days ago▲ 43Read story→
arXivarxivTAU-Agent: An Agentic Retrieval-Augmented Framework for Traffic Anomaly Understandingarxivcs.CVcs.AI28 days ago▲ 43Read story→
arXivarxivHow Robust Are Automated Fact-Checking Systems? A Cross-Benchmark Evaluationarxivcs.AIcs.LG28 days ago▲ 43Read story→
arXivarxivWhen Composition Doesn't Add Up: Humans Identifying Defects in AI-Generated Imagesarxivcs.CVcs.AI28 days ago▲ 43Read story→
arXivarxivContinually learning neural-operator surrogate for three-dimensional airborne electromagnetic Bayesian inversionarxivphysics.geo-phcs.LG28 days ago▲ 43Read story→
arXivarxivControlling for Omitted Variable Bias in Deep Neural Networksarxivstat.MEcs.CV28 days ago▲ 43Read story→
arXivarxivFormal, Executable and Explainable Runtime Monitoring of Spoken Air Traffic Control Operational Proceduresarxivcs.AIcs.CL28 days ago▲ 43Read story→
arXivarxivQuery-Side Attacks on GNN-Based KGQA: Tracing Failures from Entity Linking to Answer Generationarxivcs.CLcs.AI28 days ago▲ 43Read story→
arXivarxivRepair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systemsarxivcs.AIcs.SE28 days ago▲ 43Read story→
arXivarxivChoose Your Game Wisely: Measuring Game-Theoretic Structures in Real-World Vehicle Interactionsarxivcs.AIcs.RO28 days ago▲ 43Read story→
arXivarxivSAMpLE: A SystemC-AMS Machine LEarning-based Framework for Virtual Prototypingarxivcs.CLcs.LG28 days ago▲ 43Read story→
arXivarxivOne Form to Transfer Them All: Pretraining Multilingual Language Models Beyond Native Orthographyarxivcs.CLpublisher:arxiv28 days ago▲ 43Read story→
arXivarxivMetaSieve: Faster Relational Deep Learning through SQL-Based Metapath Selectionarxivcs.DBcs.LG28 days ago▲ 43Read story→
arXivarxivForecasting Multiple Observables with SCROLL: Score-Trained Uncertainty for Stochastic Dynamicsarxivcs.LGpublisher:arxiv28 days ago▲ 43Read story→
arXivarxivWhat FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluationarxivstat.MLcs.LG29 days ago▲ 43Read story→