Research Brief
Key Takeaways
- • Key findings from research papers
Sources
- GRACE:Gradient-guided Coreset Selection for LLM Unlearning
- EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses
- MAP: A Benchmark on Multimodal Accessibility Planning for Real World Places
- Timing-Aware Repurchase Prediction for Web-Scale E-Commerce: Survival Models for Multi-Surface Grocery Recommendation
- RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents
- VERA-8B: Evidence-Grounded Audit Risk Reasoning from SEC Filings
- Prove2Me: An Open Collaborative Platform for Scaling Math Formalization
- Program Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMs
- Logos: An Agent Harness on a Cross-Process Bus
- InstructMesh: Selective Refinement of Generative 3D Models for Fabrication
- Training Communication-Efficient Mixture-of-Experts Language Models with Layer Re-Configuration
- AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction
- COVER: Identifiable Evaluation of Coalition Routing
- Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator
- Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning
- RECAST: Recent & Context-Aware Sampling for Test-Time Adaptation in Streaming Biosignals
- Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration
- Regime-Aware Portfolio Management via Retrieval-Augmented LLM-Guided Expert Switching
- REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features
- PhenoIntel: A Lifecycle-Aligned Multi-Agent Web Application for Verified, Accessible Plant Phenotype Analysis
- Automated Analysis Framework for Multilingual Climate-Health Literature Based on Multi-Agent Large Language Model
- GOD: Govern, Observe, and Direct - A Real-Time Control Room for Agent Societies
- AERA: Adaptive Evidence Residual Allocation for Efficient Test-Time Reasoning
- SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing
- CoRe-MoE: Compact Reusable MoE for Continual Multimodal Instruction Tuning
- From Uncertainty to Clinical Risk: Severity-Aware Conformal Planning for Interactive Medical Diagnosis
- Evidential-Based Higher-Order Set Argumentation Framework
- CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action
- Context Localization for Generalized Level-Based Evaluation in Knowledge-Based Systems
- Propagating construction-time knowledge quality into medical question answering: A framework grounded in clinical guidelines
- Under-Mattress Temporal Sensing for Next-Day Agitation Risk Scoring in Dementia Wards
- Rubric-to-Code Credit Assignment for Reinforcement Learning
- PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation
- SHAPE of Chain-of-Thought in Math Reasoning
- DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation
- Expert-validated STEM QA
- A collective capability boundary in frontier large language models on guideline-conformant and case-specific oncology decision-making
- Statutory AI: Aligning Large Language Models With Legal Norms
- From Question-First to Analyst-First: Domain-Expert Skills and Verified Knowledge Compilation for Proactive Enterprise Analytics
- The Signal in the Noise: An Auditable Reliability Layer for Biomedical Text Classification
- Paper Pilot: A Human-in-the-Loop Expert System for Evidence-Traceable Scientific Manuscript Generation in Applied Sciences
- The Race between Agentic AI Capabilities and Data Quality Control in Online Surveys
- CDPR: Counterfactual Advantage-based Credit Assignment for Cost-Aware Sequential Medical Diagnosis
- Leveraging Generative AI to Design Accessible Interactive Visualizations for Undergraduate Mathematics: A Six-Phase Workflow
- Integrating Triaxial IMU Sensors and Ensemble Learning for Effective Parkinson Disease Severity Classification
- C3-UniMM: Causal Cycle-Consistent Unified Multimodal Modeling via Super Alignment and Shared Decoding Space
- MedTVL: Harnessing Vision and Language for Medical Time Series Classification
- RegDivergence-101: An LLM Benchmark for Cross-Jurisdiction Regulatory Contradiction Detection in Life Sciences
- TPvG: A Moral Decision Framework for Large Language Models from One-Shot to Sequential Feedback
- InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal
- Preference Elicitation for Policy Optimization and Application to Aligning Heart Transplantation with Human Values
- Machine Learning-Enhanced Tabu Search for Tactical Wireless Network Design
- CDEP Agent: Connecting Meteorologically Detected Temporal Compound Events to Real-World Documentary Evidence
- CrossAudit: A Git-Native, Cross-Vendor Audit Loop for Agentic Science
- AutoScientist-Quant: Self-Evolving Coding Agents for Automatic Research in Quantitative Investment
- AI Scientist Mission Control (AIMC): Visual Analytics for Human Oversight of Autonomous Scientific Discovery
- Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce
- Reward-Oracle MCTS for Formal Theorem Proving: Sample-Efficient Search and the Need for Kernel-Level Proof Auditing
- From Extraction to Governed Memory: Multi-Agent Knowledge Graph Construction with Domain-Expert Review
- BiasMix-Finance: Post-Generation KYC Guardrails for LLM Portfolio Advice
- Self-Specialized Teachers for Domain Post-Training
- How Language Models Choose Sides: Internal Representations of Instruction Hierarchy
- A Generalized Optimization Engine (GOE) for Edge AI Inference Acceleration
- Efficient Geothermal Well-Control Optimization via Diffusion-Surrogate Reinforcement Learning
- FRAC-MAS: A Safe and Explainable Multi-Agent System for Fracture Diagnosis
- ORDDAR: Observation-Driven Reasoning for Distortion-Resilient Decision, Action, and Cognitive Recovery
- Beyond the Answer Key: Robustness Evaluation of Large Language Models for Step-Level Mathematical Verification
- Pro-Router: Token-Aware Progressive Model Routing with Adaptive Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
- PermitGPT: A Unified Generative-AI Pipeline for Construction Hazard Forecasting, Permit Prediction, and Community Impact
- Formal Concept Analysis with Three Types of Negation
- Enhancing SAE-based Steering via Neighbor Integrated Feature Selection
- Capability-Stratified Degradation in Ternary Language Models
- Explainable Artificial Intelligence (XAI) in Computational Pathology: Definitions, Taxonomy, and Recommendations
- Discovering Machine Correlates of Consciousness
- BIRD-History: A Benchmark for History-Driven Text-to-SQL with Fine-Grained Knowledge Annotations
- Extending TotalSegmentator: Predicting Patient and Acquisition Characteristics from CT and MR Images
- Evaluating the Hidden Costs of Personalization in Large Language Models
- MineCEraft: Evaluating Language Models as Construction Engineers in the World of Minecraft
- Oculi: A Conversational Agentic Platform for Automated Credit Risk Analysis
- Automated Researchers Can Reliably Mitigate Alignment Failures
- From Location Phrases to Geographic Entities: Task-Adapted Retrieval for People Search
- Efficient GPU Retrieval for Semantic Search
- From Analytics to Tumor Boards: An Evidence-Linked Multi-Agent Workflow for Oncology Feature Extraction
- The Role of Network Topology and Opponent Information in Shaping Cooperation in Multi-Agent Reinforcement Learning Systems
- Selective Forgetting: A Graph-Based Memory Framework for Long-Term LLM Agents
- Agentic AI uncovers conserved cross-tissue protein co-abundance programs inaccessible to single-dataset analysis
- Verification abundance, adjudication scarcity: what happens to mathematical knowledge when proof checking becomes free
- Agent2UCB: Agentic System for Generative Engine Optimization
- Multi-Step Forecasting of Grape Berry Temperature based on LSTM Model with Feed-Forward Attention
- Frequency Selective Neural Networks as a Foundation Architecture for Time Series Learning
- Disentangling Representation using Attributes-based Gaussian Estimation for Medical Sound Diagnosis
- Facts Without Rules: Boundary Metadata Collapse in Multi-Agent LLM Handoffs
- Learning to Follow In-Context Watermark Instructions via Self-Distillation
- EmoLASP: Emotion Recognition with Language Models and Answer Set Programming
- Let Prompts Bridge Defense Knowledge: Transferable Graph Purification via Vulnerability-Aware GPL
- Imag-Eval: a language-grounded framework for interpretable Text-to-Image instruction following evaluation
- Computational Depth Measurement in Thermographic Video: Overcoming Spatial Overfitting via Spatio-Temporal Decoupling
- Revolutionizing Turn-by-Turn Navigation with Cloud-Edge Deep Learning
- Nested Convex-Body Chasing for Online Optimization with Evolving Feasible Sets
- HANIA: Planner-Guided Multimodal Graph Evidence Selection for Grounded Question Answering
- EviAnchor: Mitigating Hallucinations in Large Vision-Language Models via Regional Visual Evidence Compensation
- SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models
- Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment
- Clustering as Approximation by Constrained Projectors: Theory and Guarantees
- Emergent Misalignment Is Not Magical
- Beyond Correctness: Validity-Oriented Evaluation of Biomedical LLM Judges
- APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows
- More Perspectives, Stronger Signals: Multi-Perspective Enhancement and Progressive Fusion for Multimodal Entity Representation Learning
- JudgePanel: A Compact Judge with Panel Deliberation via Adaptive Multi-Reward Reinforcement Learning
- An Explainable Coherence Score for Detecting Temporal Inconsistencies in Political News
- How Identity and Opinion Shape Political Sycophancy in LLMs
- Benevolent Bias in Multi-Turn Human-Agent Dialogue
- Hyper-Fold: Exploring the Expressive Limit of Sequence-Geometry Learning for Proteins via Hypergraph Modeling
- Localizing Emergent Failures in Agentic AI: Recovering Minimal Repair Families via Counterfactual Replay
- Validating FKG.in: Soundness Assessment in LLM-Augmented Indian Food Knowledge
- GuardianAgent: Policy-Conditioned Risk-Adaptive Anonymization with Verified Adversarial Escalation
- Dynamic Important Example Mining for Reinforcement Finetuning
- RACER: Reinforced Agent Collaboration for Explainable Reasoning on Knowledge Graphs
- EpaCache: Error-Propagation-Aware Caching for Accelerating Diffusion-Based Visual Generation
- Understanding Deep Learning via Entropy Space Theory
- MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs
- Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling
- Predicting Future Organ Dysfunction in ICU Patients Using Temporal Convolutional Networks on MIMIC-IV Data
- Cross-Relational Preference Learning for Better LLM Instruction Following
- APPSolver: Adaptive Patch Partitioning for Point-Wise Ship Flow Prediction on Unstructured Meshes
- Plant-Inspired AI: Plants as Inspiration for Novel Problem Formulations, and Two Case Studies
- LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO
- TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning
- Reviving our data foundations is the most disruptive step to data maturity
- FORESIGHT-9: Prospective and Process-Aware Evaluation of Adaptive Trading Agents
- Evaluating Tiny Recursive Models Across Training for Code Generation
- EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants
- Toward Latent Language Model Skills Steering and Optimization: An Empirical Study
- Can escalation channels redirect reward hacking toward defect disclosure?
- Call Neighbours Yourself: Graph Walks with Destination-Conditioned On-Policy Self-Distillation
- Not Safe for All: Auditing the Dialect Penalty in Text-to-Image Safety Pipelines
- Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security
- LLMs Interpret, Embeddings Organize, Graphs Emerge: Agent-Driven Compilation of Scientific Knowledge
- Detect Before You Attribute: Cascade Failure Attribution for Multi-Agent Systems
- PAGE-RAG: Provenance-Aware Graph Evidence Promotion for Fixed-Budget Multi-hop Retrieval-Augmented Generation
- FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production
- Perceive to Hypothesize, Verify to Ground: An Agentic Reasoning Framework for Open-World Geo-Localization
- On the Instance Hardness as a Decision Criterion in TinyML Systems
- AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies
- Spatial Matryoshka Training for Multi-Granularity Visual Document Retrieval
- SearchWiki: Learning to Build and Navigate Knowledge Wikis for Active Information Seeking
- Review Before Trust: Source-Grounded Integrity Gates for AI-Assisted Personal Health Records
- EDGE: Engine for Deterministic Graph Evaluation through Conversation Simulation from Graph Structured DSL Configuration
- An Open-Source, Event-Driven Pipeline for Cryptocurrency Market Data: Ingestion, Forecasting, and On-Chain Fraud Detection
- AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning
- Automatic Conversion of NICE Guidelines to an Executable Computational Model Using Large Language Models
- Interpreting and Steering for Safe and Correct Code Generation
- Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula
- Balance of Benchmarks: Semantic Density Reweighting for Benchmark Multiplicity and Task-Conditioned Evaluation
- Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks
- Spec2Twin-Chain: Orchestrating Bi-Level Optimization with LLMs for Blockchain Digital Twin Construction
- Mitigating Over-Optimization in PRM-Guided Search in Mathematical Reasoning by Optimizing the Guide
- Game-Agnostic Value Functions through Automatic JSON Feature Extraction
- VERA: Authority-Preserving Edge Revocation for Federated AI-Agent Workflows
- A.X K2 Technical Report
- FaVOR: LLM-Based Agentic Framework for Factor Mining via Empirical Validation
- SPARK: Skeleton-Guided Reasoning Synthesis from Large-Scale Scientific Literature
- LaMoC: Loss-Aware Modular Compression for LLMs
- Rethinking the Test-Time Prompt Tuning Objective from the Perspective of Calibration
- CoLa-ICD: A Knowledge-Enhanced Framework for Long-Tail Automated Medical Coding
- LLM-Based Knowledge Graph Completion Combining Discrete Structural Coding with Similar Entity Information
- Generating Workflow DAGs from Natural Language with Non-Reasoning LLMs
- SimCRAFT: Distilling Remote Sensing Agents via Synthetic Trajectories and Contextual Retrieval-Augmented Fine-Tuning
- Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents
- Answer Probing-Guided Search for Diverse Solution Exploration of LLMs
- Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration
- Will the User Ever Know? Covert Indirect Prompt Injection Attacks on Tool-Using LLM Agents
- Augmenting Human Performance with an XR Agent Learning from Online Behavior and BCI Evidence
- Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation
- Dense Clinical Contrasts Enhance Medical Knowledge Updating in Large Language Models
- DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark
- From Metaheuristics to Exact Methods: A CP-SAT Approach for Multi-Objective Healthcare Workforce Scheduling
- EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents
- CHASE: How Content Ecosystems Are Reshaped When Ranking Is the Only Target
- CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework
- When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI
- AcCoRD: Evaluating User-Agent Collaboration Under Realistic User Preference Dynamics
- CURA: Certified Runtime Alarms for Computer-Use Agents
- Rating the Raters: Rasch Measurement Theory for LLM Evaluation
- Not All Explanations Are Sought: Information-Seeking Psychology for Human-Centered XAI
- Retrieving Relations, Detecting Fallacies: A RAG Approach to Political Debate Analysis
- LLM-Augmented Causal Discovery: Probabilistic Fusion of Edge Existence and Orientation
- CareGraph: An Auditable Hybrid AI Framework for Evidence-Grounded Personalized Longitudinal Health Intelligence
- Effectiveness of IoT and Deep Learning for Detection and Severity Assessment of Postelectrotermes militaris in Tea Plantations
- Benchmarking General Mobile Assistants in Challenging Real-World Scenarios
- Class-Based Heuristic Selection for Solving the Flying Block Puzzle
- Hypothesize, Evaluate, Refine: A Scientific Agent for PDE Discovery with Unknown Spatial Coefficient Fields
- LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails
- SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching
- WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning
- Thinking Costs Tokens: When More Structure is Worth the Price
- Generative AI Expands the Intellectual Reach of Course Based Undergraduate Research Experiences (CUREs)
- If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary
- A Framework for Object-Centric Predictive Monitoring of Collaborative Processes
- Coverage, Not Credit: Failure-Credit Routing of Zeroth-Order Perturbation Budgets Does Not Improve On-Pool Sample Efficiency for LLM Agents
- String: An Agentic OS Where Every App Is a Markdown File
- WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents
- Agents for Everyone: A Workshop Framework for Building Agentic AI Capabilities in a Distributed Curation Community
- ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL
- Credo: Reusable Declarative Primitives for Agentic Workflows
- Why Didn't It Check? Unsupported Final Claims and Their Repair in Two Tool-Equipped Language Models
- Probing Perceptual Priors of MLLMs via Gibbs Sampling with Interpretable Generative Controls
- Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning
- An Empirical Evaluation of Cross-City POI Recommendation on a Large-Scale Benchmark
- KLOD: Locality-Preserving Knowledge Editing via Non-Target Distribution Preservation
- RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
- SpikeOPD: Stable On-Policy Distillation for Autoregressive Spiking Language Models
- Resource Constraints and Performance in Agentic AI Systems
- HyQuant: Hybrid-Precision Quantization for LLM Attention
- See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs
- AI Alignment through a Game-theoretic Lens: A Survey
- From Documents to Reasoning: A Validated Synthetic Data Pipeline and Semantic-Aware Fine-Tuning for Financial Numerical Reasoning
- A Deep Learning-Based Stacking Ensemble Framework for Turbofan Engine Remaining Useful Life Prediction
- CASTANET: Causality-Aware Spatio-Temporal Adversarial Network Using Traffic Incident Effects
- Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense
- The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs
- When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation
- Should I Use This Synthetic Dataset for Training? How to Test with Minimal Real Data
- When Evidence Shapes Collaboration: Knowledge-Conditioned Topology Generation for Multi-Agent Systems
- Learning from Hard Prompts: Difficulty-aware Advantage Amplification in Dynamic Sampling
- openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents
- The Shape of Power: A Multilingual Framework for Social Power Reasoning in Dialogues
- Speculative Probing: LLM Monitoring at Speculative-Decoding Cost
- SEPO: Evidence-Grounded Prompt Optimization via Structural Editing
- Stay Within Your Bounds: Distance-Guided Decoding for Guaranteed Context-Free Grammar Compliance
- Generative AI Alignment with Hinduism's Theological Plurality and Sacred Representation
- Expert Knowledge & Machine Understanding: Bridging Reactome's Ontology with LLM Semantic Embeddings
- CrabOS: An Operating System for Human-AI Co-inhabitation
- Physics-Guided Flow Matching for CT Image Reconstruction
- Beyond Task-Only Matching: Personalized Skill Routing with Counterfactual Evaluation
- Memristive-Friendly Hadamard Reservoir Computing: Structured, Multiplier-Free Recurrences at Scale
- LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
- AGENT-O: A Semantic Agent Card Framework for Interoperable and Governed Healthcare AI Agents
- Real-Valued Hyperdimensional Sequence Representations with Hadamard Product Binding and Shift Equivariance
- MAIL: Memory-driven, Adaptive, Incremental, and Literature-grounded Framework for Hypothesis Generation in Chemistry
- Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
- ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions
- Learning-Assisted Congestion-Aware Route Scheduling for Semiconductor Fab Material Control Systems
- DiffPDE: Masked Diffusion Language Models as PDE Solver
- Designing an Auditable LLM-Supported Workflow for Qualitative Thematic Analysis
- GarmentWeaver: Schema-Aware Structured Synthesis for Multimodal Sewing Patterns
- AdaPath: Query-Adaptive Path-Finding via Path-Bank for Multi-Hop Implicit Biomedical KGQA
- TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI
- Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle
- Geometry of Divergence: Tracking Hidden-State Trajectories for Adaptive Multi-Turn Reasoning
- PyKEEN-NSX: A Modular Framework for Static, Dynamic and Schema-Aware Negative Sampling in PyKEEN
- HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving
- MedAgent-R1: Faithfulness-Aware Reinforcement Learning for Evidence-Grounded Medical Reasoning
- ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents
- Multimodal Adaptive Expert Selection with Text Routing and Ordinal Prototype Optimization for Sentiment Analysis
- Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models
- Which Rules Matter Now? Policy-Centroid Routing Before an Intelligent System Acts
- SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents
- HSRM: Hidden-State Reward Models for Test-Time Verification
- VFR-Audit: Verdict-Level Reliability for Fairness Audits in Hospital Length-of-Stay Prediction
- Predicting Residential Rents in Dakar Using Machine Learning
- CAER: Causal Action Effect Reweighting for World Model Training
- Responsible Integration of AI in Cancer Genomics: Barriers, Risks, and Pathways to Trustworthy Clinical Translation
- CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models
- Learning Action Models with Conditional and Quantified Effects via Uncertainty-Guided Exploration
- MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents
- Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents
- Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores
- Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
- Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization
- Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
- Cross-Regional Grapevine Cold Hardiness Prediction via Learned Multimodal Latent Representations
- BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing
- When Does Bigger Help? A Controlled Study of LLM Scale for Ontology Learning
- OntoAligner-Ensemble: Voting-Based Fusion across Heterogeneous Ontology Alignment Techniques
Comments
Please log in to post a comment.