Recent advances enhance LLM reliability through code-based harnesses, synthetic calibration, and trajectory audits, while domain-specific applications span formalized math archives, embodied event planning, and biomedical tabular optimization. Enterprise agents utilize latent equivalence learning for routing, and attention mechanisms are extracted as live graphs from single forward passes. Social reasoning improvements via ReAdapt boost warm-introduction accuracy from 37% to 51%, and the AI Neuroscientist enables natural-language fNIRS analysis. Retrieval throughput increases 1.28β4.52Γ via Orthrus heterogeneous batching, though dialogue studies reveal 'early posterior collapse' hindering correction. Chain-of-thought load-bearingness is driven 98.8% by task difficulty, complicating safety monitoring, while RAG-NAROK exploits retrieval transparency to poison knowledge bases more effectively than static attacks.
Privacy-preserving multi-agent workflows and robust knowledge distillation from cross-model failures address security gaps, alongside attentional impacts of false-positive CADe prompts in colonoscopy. Automated theorem proving utilizes search-aware loss functions, yet debate mechanisms risk erasing necessary disagreement without improving accuracy. Smaller LLMs benefit from self-evolving reasoning curricula, and specialized agents like ChatT2 assist natural product research. ArticleMiner constructs ontology-guided knowledge graphs, whereas coding agents struggle to generate exploit primitives despite finding vulnerabilities. Traditional Chinese Medicine knowledge graphs utilize confidence-aware querying, and neurosymbolic models successfully learn action models under partial observability. Post-training erases cross-cultural variance via 'consensus collapse,' while OmniFysics-Nano-V2 improves physical-world understanding across modalities.
Medical imaging advances include DW-MRI temporal deep learning predicting breast cancer response with 0.90 AUC after one cycle, and multimodal pretreatment models achieving 0.86 AUC using diffusion and contrast-enhanced MRI. FusionMMT unifies multimodal multitask learning for nuclear fusion diagnostics, outperforming prior methods on the EAST-VTD640 dataset. CLAIM generates K-12 assessment items with 97.8% expert pass rates, revealing asymmetries where fill-in-the-blank generation lags behind multiple-choice. Online sequential testing identifies LLMs via probe design, framing model selection as a weighted set cover problem. TREND-10K introduces a 10,000-video dataset for quality assessment, while EADC evaluates LLM compliance using legal knowledge graphs to detect deep regulatory blind spots.
SWE-Serve benchmarks agentic engineering, revealing a gap where 45.9% of locally passing patches fail end-to-end production tests. Transformer-based models improve real-time hand gesture recognition via OpenXR, and Null-Basis LoRA preserves reasoning in post-RL LLMs during fine-tuning. Rollout efficiency is critical for reasoning RL, requiring new taxonomies, while ZeroGate uses fast paths for AI agents but shows prepared admission adds latency. A layered framework aligns offline proxies with online A/B tests, achieving 81.1% F1, and decision models follow option names over rubrics, causing errors despite type safety. Quantum search reduces active device detection complexity in energy-harvesting networks, and JEV-as-a-Judge offers economical evaluation retaining 99% accuracy via cascading.
Verdict substitution harms verifiers by -11.2pp but benefits them in other configs by +24.2pp, driven by state-specific accuracy. Exact-support generation trades front-loaded coordination for online memory, with costs scaling by conservation rank. ChainUQ improves LLM uncertainty via reasoning consistency, gaining 3.1% AUROC and 45% ECE reduction. Runtime policies (FIRE) boost agent reliability on Terminal-Bench 2.1, converting reachable solutions into dependable delivery. VideoX-Qwen uses 1.2M+ data records to achieve top performance on 9/11 video editing metrics, while trait interference in LLM simulators is mitigated by PQA. Contrastive Epistemic Decoding neutralizes swarm consensus, recovering up to 30.75% accuracy, and audits find queer representation is 0-1.4% in speech datasets.
LSTM ensembles with PSO predict Ajichay River runoff with $R^2$ 74.95β91.42%, and multiplayer bandit algorithms using KL bounds improve regret guarantees by at least two. Dual-Frontier formalizes world-model failure attribution, admitting decisions only when advantage exceeds certified error bounds. FISSION generates labels by splitting account activity, outperforming prior bot detection methods, while ENTOP audits evidential learning showing implicit training lacks count signal. REFLEX uses a typed decision layer to reduce strong-model calls by 72.7% while maintaining 95% success. AIDE$^2$ achieves recursive self-improvement, discovering seven code changes that reduce reward hacking from 55% to 32%. Adaptive regulation burden varies by disturbance source, with internal noise causing largest exposure, and neutral-atom quantum computing solves NP-hard NOMA resource allocation via MIS reformulation.
Hybrid AI frameworks for academic advising use Stacking Ensemble models (RMSE 2.35) on 416,558 University of Birjand records. MAC-RRG, an iterative multi-agent framework for X-ray report generation, fuses multimodal knowledge graphs to reduce hallucinations. MaP, a masked trajectory prediction framework, resolves gradient conflicts in multi-task GUI navigation. Task state enforcement improves LLM agent reliability on state-decidable failures but harms performance when the gate is incorrect, while self-written ledgers often outperform shown checklists. MedGate-Fusion integrates narratives and biomarkers for stroke risk stratification using 102,736 Canadian patient records with redacted terms. FairMon, a runtime monitoring tool using extended RTLola and real-time visualization, analyzes algorithmic fairness in high-stakes systems.
Key Takeaways
- ReAdapt boosts warm-introduction accuracy from 37% to 51% via explicit social state modeling.
- Orthrus enhances retrieval throughput 1.28β4.52Γ using heterogeneous batching strategies.
- DW-MRI temporal deep learning predicts breast cancer response with 0.90 AUC after one cycle.
- CLAIM generates K-12 assessment items achieving 97.8% expert pass rates.
- SWE-Serve reveals 45.9% of locally passing patches fail end-to-end production tests.
- ChainUQ improves LLM uncertainty via reasoning consistency, gaining 3.1% AUROC.
- AIDE$^2$ reduces reward hacking from 55% to 32% through recursive self-improvement.
- MedGate-Fusion stratifies stroke risk using 102,736 Canadian patient records.
- FairMon analyzes algorithmic fairness in high-stakes systems using extended RTLola.
- Neutral-atom quantum computing solves NP-hard NOMA resource allocation via MIS reformulation.
Sources
- Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents
- Seeing Is Not Perceiving: When Synthetic Consumers Can and Cannot Pretest Visual Marketing
- Testing-Driven Reliability Audit of Trajectory-Based Early Outcome Prediction for LLM Agents: Target-Specific Calibration Transfer Persists Within a Single Benchmark
- Lean Pool: An AI-Maintained Archive of Formalized Mathematics
- X-Planner: Event-Structured Task Planning for Embodied Intelligence
- An Accurate and Interpretable Hyper Graph Neural Network for GBM Survival Prediction
- 4DGS-JEPA: Temporally Compositional Joint-Embedding Prediction for Dynamic Gaussian Splatting
- Do Existing Preconditioners Improve Biomedical Tabular Foundation Learning? An Empirical Study on TabPFN Optimization
- Potential for Enhanced Learning in Machine Learning Classes by Using Wiki LLM Indexing
- Making Agents More Consistent: Skills Should Form Habits for Repeat Tasks
- Learned Enterprise Data Comprehension: Compression and Routing for Data Agents
- Attention as a Routing Graph: Live Circuit Extraction from a Single Forward Pass
- When LLM Agents Fail to Read the Room: ReAdapt for Relational Social Reasoning
- The AI Neuroscientist: An Interactive Agentic Interface for Neuroimaging Analysis
- Efficient Iterative Retrieval with Heterogeneous Batching
- Clarification Is Not Correction: LLMs Fail to Let Go
- From Decorative to Load-Bearing: Task Difficulty Shapes the Causal Role of Chain-of-Thought
- RAG-NAROK: Retrieval-Aware Knowledge Corpus Poisoning in RAG with Source-specific Refutation
- ShowTellArena: Evaluating Business Workflow Understanding from Demonstrations
- When Big Data Becomes a Curse: Spatial Heterogeneity and the Limits of Learning from Passive Acoustic Monitoring Data
- VACS: Value-Aligned Compositional Shielding for Multi-Agent Reasoning
- Weakly Supervised Quantum Error Mitigation
- Towards participatory speech dataset curation: A queer case study and conceptual framework
- SMTB: Fast Structure-Mapping with Tight Bounds
- Selection-Invariant Communication Compilers for Privacy-Aware Multi-Agent LLM Workflows
- Robust Failure, Conservative Repair: Textual Knowledge Distillation from Cross-Model Failures
- Gaze responses to false-positive computer-aided detection prompts during colonoscopy: a paired-video and real-time eye-tracking study
- Direct Optimization of Generators for Search in Automated Theorem Proving
- Unanimity Without Persuasion: A Single Round of Debate Erases the Disagreement That Verification Needs
- Ladders of Thought: A Self-Evolving Curriculum of Progressively Simplified Reasoning Traces
- ChatT2: An Adaptive Framework for Developing a Large Language Model-Based Agent for Natural Product Domain Research
- ArticleMiner: Ontology-Guided Knowledge Graph Construction from Scientific Publications
- Evaluating Coding Agents on Kernel Exploit Generation
- TCMaster: Confidence-Aware Querying and Workload-Guided Physical Design for Multi-Source Traditional Chinese Medicine Knowledge Graphs
- Toolcompass: Guiding Tool Trialing, Not Suppressing It
- Neurosymbolic Action Model Learning under Partial Observability
- The Limits of Simulated Societies: How Post-Training and Survey Fine-Tuning Erase Cross-Cultural Variance
- OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities
- LingLan: An Advancing Traditional Chinese Medicine Diagnosis LLM with Multimodal Data
- CausalLoss-Fin: Attributing Financial-Agent Loss to Decisions and Infrastructure Faults
- AgenticSizing: A Large Language Model-based Multi-Agent Framework for Analog Circuit Sizing
- Prediction Is Not Detection: Evaluating Pre-Recognition Claims in Longitudinal Clinical AI
- Optimizing the Score, Losing Sight of the Task: Reward Hacking Across Weights, Selection, and Prompts
- The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
- When Are Aggregate Agent Traces Diagnosable? Traffic-Governed Interpretation and Calibrated Abstention
- Adversarial Course-of-Action Generation: Game-Theoretic Multi-Agent Algorithms for COA matching & COA generation
- Canonical locks that encode part-whole hierarchies
- CQ4OE: A benchmark for assessing LLM-assisted ontology generation from competency questions
- RankCert: When Can Simulated Learners Safely Select an AI Tutor? Robust Decision Certification Under Structural Uncertainty
- DTOC: Dynamic Tool Output Compression for Adaptive Context Management in AI Agents
- Early Prediction of Pathological Complete Response to Neoadjuvant Chemotherapy Using Temporal Deep Learning on DWI
- Neoadjuvant chemotherapy response prediction using pretreatment diffusion and contrast-enhanced magnetic resonance imaging with clinical variables
- FusionMMT: A Unified Multimodal and Multitask Learning Framework for Nuclear Fusion
- The Architect, the Adversary, and the Judge: Closed-Loop Generation of Standards-Aligned Assessment Items at Scale
- Identifying Intelligent Processes via Online Sequential Testing
- TREND-10K: A Comprehensive Dataset for Next-Generation Video Quality Assessment Based on Preference-Driven Media
- EADC: Evaluation of Advanced and Deep-level Compliance in Large Language Models
- The Free-Recipe Limit: Every Recipe Effect Measures Which Premise of an Idealised Learner Broke
- A Multi-Timestep LSTM Ensemble regressor for Enhanced Short-Term Runoff Prediction
- Improved Multiplayer Bandit Algorithm for Bernoulli Rewards
- Dual-Frontier: When Can an Agent Trust Its World Model?
- FISSION: Label Augmentation for Bot Detection
- Decoupling Is Not Identification: Supervised Evidential Learning in Next-Token Prediction
- REFLEX with Jev for Efficient Selective Control in LLM Agents
- Reproducible AI Requires Reproducible Randomness
- Recursive self-improvement of AI research agents
- The Source of Disturbance Matters: External, Internal, and Control-Generated Noise in Adaptive Regulation
- The Delegation Blind Spot: Auditing Product Decisions from Agent Choices
- Neutral-Atom-based Quantum Optimization for Resource Allocation in NOMA Networks
- CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents
- SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving
- Real-Time Hand Gesture Recognition for OpenXR Using Transformer-Based Machine Learning
- Reasoning-Preserving Fine-Tuning of Post-RL LLMs with Null-Basis LoRA
- Transformer Heads Looking for Order
- Rollout Efficiency in Reinforcement Learning for Reasoning Large Language Models: A Taxonomy and Future Directions
- ZeroGate: Trust-Preserving Fast Paths for Governed AI Agent Runtimes
- From Offline Proxies to Online Decisions: A Layered Engagement Evaluation Framework for Conversational AI
- Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It
- Quantum-Aided Active Device Detection in Energy-Harvesting Symbiotic Radio Networks
- JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
- RCShift: Certifying When Partial Linkage Suffices for Finite-Sample Decisions
- Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
- Toward User-Mediated Self-Repair in Ubiquitous Robots Through Goal-Oriented Agentic AI
- When Verifiers Vote Backwards under Verdict Substitution: Signed Pivotal Value in Correlated Self-Consistency
- The Cost of Conservation: Coordination-Memory Laws for Exact-Support Generation
- ChainUQ: Reasoning Consistency-Aware Uncertainty Quantification for Large Language Models
- FIRE: Failure-Informed Runtime Engineering for Reliable Language-Model Agents
- VideoX-Qwen: Data-Centric Instruction-Based Video Editing
- A Behavioral Trait Leaks into Preferences: Diagnosing Trait Interference in LLM User Simulators
- Recovering Agentic Sovereignty: Mitigating the Consensus Paradox via Contrastive Epistemic Decoding
- Queer inclusion in speech datasets: An audit and taxonomy of practical tensions
- Spectra: A Rules-Driven LLM Pipeline for Automated KYC Document Processing
- Do Synthetic Personas Predict Real Audience Response? A Sim-to-Real Study Where a No-Persona Baseline Beats Persona-Based Copy Simulation
- Reliability Theory for AI Control
- Coding Agents are Strong Prompt Optimizers
- A Hybrid AI Framework for Academic Advising: Integrating Ensemble-Based Grade Prediction and a Rule-Based Expert System
- MAC-RRG: Iterative Multi-Agent Collaboration for X-ray Radiology Report Generation
- Towards Omni-dimensional GUI Agent Navigation with Masked Trajectory Prediction
- How Strongly Should Task State Influence an LLM Agent?
- MedGate-Fusion: Integrating First-Encounter Semantic Narratives and Physiological Biomarkers for Prospective Stroke Risk Stratification
- FairMon: A Tool for Monitoring and Visualizing Algorithmic Fairness
Comments
Please log in to post a comment.