arXivarxivCurvature-Conditioned Multiscale Momentum with Sphere Constraints for LLM Pretrainingarxivcs.LGpublisher:arxiv17 days ago▲ 43Read story→
arXivarxivFidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extractionarxivcs.CLcs.AI17 days ago▲ 43Read story→
arXivarxivProve2Me: An Open Collaborative Platform for Scaling Math Formalizationarxivcs.AIcs.LO17 days ago▲ 43Read story→
arXivarxivAre These Modules Worth Their Cost? A Paradigm-Level Accuracy-Cost Analysis of In-context Learning Text-to-SQLarxivcs.CLcs.AI17 days ago▲ 43Read story→
arXivarxivProgram Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMsarxivcs.AIpublisher:arxiv17 days ago▲ 43Read story→
arXivarxivLongPIBench: A Long-Context Benchmark for Prompt Injectionarxivcs.CRcs.AI17 days ago▲ 43Read story→
arXivarxivSymboLLM-FE: LLM-Accelerated Symbolic Regression for Automated Feature Engineering on Tabular Dataarxivcs.LGpublisher:arxiv17 days ago▲ 43Read story→
arXivarxivA Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoringarxivcs.CLpublisher:arxiv17 days ago▲ 43Read story→
arXivarxivCritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modesarxivcs.CLpublisher:arxiv18 days ago▲ 43Read story→
arXivarxivWikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolutionarxivcs.AIcs.CL18 days ago▲ 43Read story→
arXivarxivFrom Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bencharxivcs.SEcs.AI18 days ago▲ 43Read story→
arXivarxivRedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolutionarxivcs.CRcs.AI18 days ago▲ 43Read story→
arXivarxivMechanistic Reaction Prediction via Discrete Flow Matching on Graph-Structured Electron Occupationarxivcs.AIpublisher:arxiv18 days ago▲ 43Read story→
arXivarxivStochastic Estimation of Transduced Language Modelsarxivcs.CLpublisher:arxiv18 days ago▲ 43Read story→
arXivarxivPersona-Execution Separation: An Architecture Pattern for Evolving LLM Agents under Execution Auditarxivcs.SEcs.AI18 days ago▲ 43Read story→
arXivarxivBeyond F1: Evaluating Coverage and Failure Recovery in AI Model Security Scannersarxivcs.CRcs.AI18 days ago▲ 43Read story→