Research Brief
Key Takeaways
- • Key findings from research papers
Sources
- Revisiting Classic Thought Experiments to Measure Consciousness for Artificial Intelligence Safety
- Enhancing LLMs with Context-Specific Knowledge for Mitigating Misinformation in SMEs: A RAG-based Modeling and Analysis
- Memory Reward Inflation in Self-Improving LLM Agents
- CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection
- Nova: An End-to-End MLIR Compiler for Deep Learning
- SIRIN: A Unified Toolkit for Detecting Contextual Hallucinations in Retrieval-Augmented and Memory-Grounded LLM Systems
- RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models
- Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale
- TRACE-TS: Attribution-Grounded and Traceable Sensor-Language Reasoning for Human Activity Understanding
- Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment Snapshot
- Geometric Self-Supervised Pre-training for Neural Combinatorial Optimization
- RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning
- Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates
- Gene Ontology-Guided Hierarchical Spatial Gene Expression Prediction from Histopathology Images
- Where did the ambiguity go? Examining how multimodal models interpret polysemous words
- Ekova: A Personality-Support Agent for Self-Discovery Dialogue
- Diagnose Before You Compress: Prediction-Independent Bottleneck Witness Refinement for LLM Serving Traces
- TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs
- TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation
- Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models
- Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations
- CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding
- Slides2MindMap: Reconstructing Cognitively Efficient Knowledge Hierarchies from Lecture Slides
- Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems
- HetGPS: Scalable Graph Multi-Agent Reinforcement Learning with Physics-Anchored Adaptive Safety for EV Charging
- Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations
- FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction
- Behavioral Grammar: Detecting Adaptive Malware via Tiny Language Model Priors and Second-Order Temporal Analysis
- AgentSLABench: Evaluating and Benchmarking Agentic Systems Under Resource Constraints
- The Scaling Paradox in Human-AI Collaboration
- Similarity Weighted Aggregation with Global Differential Privacy for Federated Brain Lesion Segmentation
- Neuro-Evolved Heuristics for Variable Gapped Common Subsequence Identification
- TrajWiki: Source-Grounded Memory Trajectories for Long-Horizon Dialogue Agents
- Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel
- PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent
- Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable
- Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models
- Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
- FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds
- Role-Decoupled Attention Residuals: Separating Matching and Content Retrieval Across Depth
- Control Under Compression: Reliability Frontiers for Tool-Using Agents
- Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating
- Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races
- The Graph Language: How Knowledge Graphs Speak to Large Language Models
- G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution
- Agentic Stage-One Stellarator Optimization: Autonomous Multi-Objective Search for Finite-Beta Equilibria
- CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories
- KoVRE: Training an Efficient Embedding Model for Korean Visual Document Retrieval
- MRAFnd: Multimodal Retrieval-Augmented Framework for Zero-Shot Fake News Detection
- Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning
- Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI
- Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning
- Securing Agentic AI: From Per-Action Checks to Trajectory Assurance
- Emergence Invariance: From Symbolized Thought to Interface Refinement
- MineGrad: Gradient Inversion Attacks on LoRA Fine-Tuning
- Computing with Agentic Oracles
- Does the Competitive Component of Adversarial Self-Play Improve Legal Reasoning? A Controlled Negative Result
- When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses
- LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing
- When Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation Boundary
- DAPD: Dual-Anchored Policy Distillation
- Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
- MemSIF: From Structured Interactions to Dual-Track Fact Memory for LLM Agents
- FRAMES: Guarded and Dual-Objective Skill Evolution for Agents in Policy-Governed Enterprise Workflows
- CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning
- Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction
- PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
- SearchMaster: Grounded and Regulated Self-Play for Search Agents
- Physics-Informed Neural Networks for Complex Eigenfrequency Identification and Mode Structure Reconstruction of the Ground-State ITG Branch
- EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning
- ReasonCast: Towards Explainable Time Series Forecasting with Reasoning
- Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study
- EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers
- Before Reasoning Can Fail: Pre-Evidence Procedural Failures in Agentic RAG
- HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning
- Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation
- MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents
- PAC Approximation and DIRECT Optimization for Parametric Markov Models
- Homebot: A Personal AI Agent for Conversational Home Assistance and Automation
- PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs
- Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit
- Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning
- KC-Agent: A Dual-Process Cognitive Architecture for Efficient ML Model Improvement
- Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling
- Faster-WAM: Do World Action Models Need Deep Action Modules?
- Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
- Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce
- xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
- Real-Time Detection and Repair of LLM Agent Failures
- Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation
- AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies
- Cross-Fitted Residual Utility for Primary-Preserving Cognitive Decision Correction in Automatic Modulation Classification
- HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents
- Evolving in the Agent Jungle via History-Informed Opponent Awareness
- A Contractualist Argumentation Framework for Moral Decision-Making
- ProWorld: Progress-Aware Hyperbolic World Models for Long-Horizon Visual Goal Reaching
- Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents
- CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits
- REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models
- Leveraging AI for fine-grained food safety risk forecasting in sparse data conditions
- RL-Lock: Reinforcement Learning for Generating Interlocking Assemblies
- CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents
- Salami Attack: Stealthy Collusive Memory Poisoning against OpenClaw
- Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer
- Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning
- Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning
- V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory
- A Taxonomy of Cognitive Capability Gaps in Generative and Agentic AI
- Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation
- Optimizing Minimax Regret in Uncertain MDPs with Small Sets of Policies
- CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization
- Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions
- Infinite Trace Objectives with Finite Trace Techniques: Translating LTL to LTLf+
- ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision
- Hard Constraints, Smooth Gradients: Learning Feasible Inventory Policies via Differentiable Projection
- MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4
- SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
- Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
- Self-Certification of Representation Adequacy: Sequential Certification at Minimum Task Loss
- Trustworthy AI in Digital Health: A Comprehensive Review of Robustness and Explainability
- CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents
- Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge
- Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models
- FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling
- Rewriting or Reweighting? A Geometric Account in Language Models
- Sweet Little Lies: Strategic Deception in AI Emotional Support Chatbots
- Where Reasoning Diverges: Localized Multi-Agent Debate for Multi-Hop Question Answering
- A New Theory of Value for Post-AGI Economics
- PolymerGPT: Multi-property Optimization with a Decoder-Based GPT Model for Generative Polymer Design
- Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics
- Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination
- CT-PrepAgent: Bounded Policy and Controlled Execution for Adaptive CT Data Preparation
- Perspectives on Tsallis Statistics for Artificial Intelligence
- Reputation-driven Cooperation in Lattice-based Decentralized Federated Learning through Evolutionary Game Theory
- Co-evolution of social reward and punishment under institutional interventions
- PATH-Bench: Path-Dependent Evaluation of Lifelong Agents
- MA-HEAD-Net: Adaptive Rule-Guided Multi-Agent DRL for AoI Minimization in UAV-Assisted Emergency Networks
- Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering
- PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents
- Modeling Social Dynamics with an LLM-Enabled Agent Based Network-Dynamic (LAND) Model
- CADIR: A Cross-Backend Editable Intermediate Representation for Agentic CAD Generation
- Assuming You Knew: Fixing an Epistemic Semantics for Flow Policies Using Agentic AI
- Evolutionary Curriculum Learning Improves Biological Sequence Modeling
- When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty
- DASH: Decoupled Adaptive Surrogate - Acquisition Harness for Automated Bayesian Optimization
- Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
- Bayesian and Motivated Reasoning in AI Agents
- Trust and Its Betrayal under Three Representational Strategies
- CrystalMem: Elastic Memory for Self-Evolving LLM Agents via Knowledge Crystallization
- WM-Cov: Test Adequacy for Interactive World-Model-Style Autonomous Driving Simulation
- RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals
- More Debate, Same Evidence: Structural Limits of Homogeneous Multi-Agent Groundedness
- Motif-Mamba: network motif improved mamba for long-range sequence modeling
- Request-Level Energy Attribution for Batched LLM Serving
- Optimization and Constraint Modeling using LLMs with a Retrieval Augmented Generation Process
- Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware
- AutoFOAM: The Self-Refining Autonomous OpenFOAM Agent
- Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks
- MEGRAG: Multi-Granular Evidence Graphs for Answer-Aware Multi-Hop RAG
- From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents
- From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution
- Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints
- Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning
- Beyond Solution-Centric Search: Adaptive Inquiry and Knowledge Revision for Autonomous ML Engineering
- GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks
- No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks
- CRAFTS: Collaborative Role-Adaptive Fine-Tuning of LLM Agents for Chemical Process Simulation
- High-Stakes Decisions with Language Models: Insights from Emergency Triage
- 402Pilot: An x402 Decision Layer for Autonomous Agent Micropayments
- SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling
- Isotropy Cliffs: The Geometric Signature of Decision-Making in Large Language Models
- Large language models improve physician accuracy but lead to false reliance
- Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
- AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their Impact on Automated Assessment
- SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs
- Personalizing Large Language Model Agents with Small Policy Models
- AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?
- Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce
- H+ Embedding: Harmonizing Global and Token-Level Retrieval with Context-Dependent Phrases
- Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents
- LaCache: Robust Semantic Caching for LLM Serving
- Constructing Executable Analytical Knowledge Representations for Meta-Analysis Synthesis Using an Agentic Harness
- Beyond Single-Use Tokens: Durable Authorization State for Replay-Resistant LLM Agent Actions
- GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks
- TCPO: Turn-Level Credit Policy Optimization
- Allocation Before Ranking: Decoupled Token Compression for OmniLLMs
- DGA$_2$D: Directed Graph-Guided Automated Algorithm Design with Large Language Models
- BayesSeg: A Bayesian Optimization Framework for State Segmentation of Electricity Consumption Time Series
- The Bayesian Reflex: A Predictive Coding Engine for Artificial Intelligence
- F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models
- Mask-Based Priors Are More Persistent than Query-Key Initializations
- MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models
- SkillTrace: Traversing a Query-Skill Graph for Composable LLM Agents
- Cognitive Demand Steering for Adaptive Meta-Reasoning in Large Language Models
- Inter-Residue Geometry Attention for Antibody-Specific Epitope Prediction
- Don't Offer What Can't Be Done: Deterministic Executability Gating for LLM Skill Selection at Scale
- From AI Technical Debt to Agentic Technical Debt: A Systematic Mapping of Root Causes and Manifestations in Agentic AI Systems
- Linguistic Context Recodes Visual Representations in Vision-Language Models
- ISEE: Interactive Semantic Enrichment for Database Fields
- Self-Organising Digital Circuits
- Beyond the Hivemind: Escaping LLM Homogeneity via Meta-Persona Anchoring and Sequential Temperature Scaling
- PULSE: An Executable Contract Language for Spatiotemporal Knowledge Graph Engineering
- HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents
- Explainable AI for the EU Right to Explanation: A Systematic Review of the Law-XAI Translation Gap
- Predictive Set Theory: A Generative Framework for Cognitive Architecture with Operationalized Core Mechanisms
- Towards a new paradigm of scientific discovery with socialized artificial intelligence
- BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL
- VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space
- Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes
- Hypercubes, Hyperplanes, and Constraint-Induced Complexity Collapse in Atomic Concept Learning
- When Compression Scores Cannot Decide: Information Boundaries for Group-Robust LLM Pruning
- On the missing data layer and a potential solution
- Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning
- On the missing benchmarks layer and a potential solution
- ProPRL: Property-Aware Prerequisite Relation Learning in Educational Knowledge Graphs
- UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks
- LoCA: Forward-Only LLM Tuning after One-Shot Calibration with Local Credit Assignment
- DiffImaginE: Imagine to Verify Entity Types with Diffusio
- Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning
- CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting
- TraceCAD: Trace-Guided Repair for Agentic CAD Generation
- Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls
- AI Agent Economics: Can Autonomous Economic Behavior Emerge among AI Agents under Minimal External Conditions?
- Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR
- Beyond Average Performance: Dynamic Instance Clustering and Specialized Algorithm Design in LLM-Assisted Evolutionary Search
- Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents
- Spatial proteomics guided by H&E-based AI reveals recurrence-risk niches in triple-negative breast cancer
- UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval
- Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning
- Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation
- Surrogate Substitution Preserves PHI Detectability: A Multi-Detector Equivalence Study
- Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Domain QA
- TumorBoard: Evidence-Grounded Multi-Agent Decision Support for Longitudinal Neuro-Oncology
- When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models
- The Agent Operating System (AOS): A Reference Operating Architecture for Distributed Agentic Systems
- One Knob to Rule Them All: A Unified Optimal Transport View of Cold-Start Active Learning
- DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
- AgentPanel: Toward a New Paradigm for Human--AI Collaboration in Exploring Scientific Questions
- SeaSlides: Semantic Abstraction Layer for Agentic Slide Generation
- Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
- Long-term Traffic Scene Prediction via Polynomial Representations in Autonomous Driving
- AutoSND: From Execution Evidence to Structural Policies for Automated Network Dismantling Heuristic Discovery
- Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details
- Enhancing Tabular Learners with Context-Aware Semantic Embeddings
- Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS
- Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks
- WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks
- Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems
- Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance
- MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents
- Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems
- MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models
- Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents
- FraQ: Efficient Coordinate-Space Recompression for Federated Low-Rank Adaptation
- Policy Fragmentation or Institutional Alignment? Institutional Governance of AI in Universities and Business Schools
- When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO
- LeanMem: Simple and Efficient Long-Term Memory for LLM Agents
- Distractor-Aware Truncation: Disentangling Context-Length Effects from Signal Loss in Long-Context LLM Benchmarks
- TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning
- UniNav: A Unified World-Action Diffusion Model for Visual Navigation
- Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains
- Chess on Ice: Curling Tactical Decision-Making via Backward Induction and Deep Reinforcement Learning
- Traceable Multi-Agent System for Knowledge-Based Forecasting
- MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc
- AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction
- Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory
- State Propagation Also Satisfies: A Complex-Valued State-Space Model for Deterministic State Tracking
- DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
- LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
- Solver-Aware Decompositions for Programming-by-Example: When Dividing Requires Knowing how to Conquer
- ChartAnno: Evaluating MLLMs for Chart Annotation Generation
- ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning
- Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design
- Reversing Arrows in Large Language Models
- When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs
- Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities
- Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
- Behaviorally Adaptive Visual Diversion for Inclusive and Resilient Digital Assessment Delivery
- FOUND-AF: Benchmarking ECG Foundation Models for Atrial Fibrillation Detection
- From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities
- Large language models for partial differential equation workflows
- Formal Verification of Agentic Systems over Operational Data
- Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations
- Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection
- Cross-Layer Interaction under Weight-Space Ablation: A Closed-Form Attention Jacobian Bound and a Test on a Real Pretrained Model
- When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
- Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training
- PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud
- SAT-Edge-Agent: Hardware-in-the-Loop Edge-Agent Orchestration for Onboard Satellite Intelligence
- CARE-Bench: Benchmarking Patient-Facing LLM Triage
- Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement
- AgenticECO: An Agentic Framework for ECO on 3D Integrated Circuits
- Risky Business: Measuring The Faithfulness-Safety Tension
- KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation
- Computing Actual Causes for Neural Network Predictions under Structured Causal Inputs
- GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
- LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards
- ADMITBench: A Safety-Governed Reference Framework for Evaluating the Admissibility of Industrial LLM Advisories
- TACT: Taxonomy-Aligned Post-Training for Pedagogically Adaptive English Tutoring
- Implementing Causal Perception: Competing SCMs and Situated Fairness
- The Transformer Revolution, Part 1: Dynamic Processing through Output- Weight Interconnections
- Socially Grounded Agentic AI: Coordinating Plural Perspectives through Social Theory
- When Efficiency Becomes Fragility: Exploiting Dynamic Routing Vulnerabilities in Adaptive UAV Tracking
- ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning
- Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations
- Interpretable Adaptive Sampling for LLM Test-Time Scaling
- Oilbird: Training-Free Speculative Decoding with Keys the Verifier Already Computes
- Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation
- A game theory for foundation models shows new paths to rational cooperation through similarity inference
- Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition
- ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
- When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine Collectives
- Less Traffic, Better Outcomes: Competition-Aware Request Dispatch in Real-Time Ad Exchanges
- TARL: Transaction-Aware Reliable Ledgers for Executable Memory Management in Long-Term Agents
- LiveEvalBench: Toward Open-World Evaluation for Web Generation
- Shielding for Higher-Order Safety
Comments
Please log in to post a comment.