EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness? Paper • 2609.04280 • Published Sep 3 • 32
Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers Paper • 2606.31779 • Published Jun 30 • 3
Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents Paper • 2606.26080 • Published Jun 24 • 13
DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models Paper • 2606.05758 • Published Jun 4 • 5
Breakeven complexity: A new perspective on neural partial differential equation solvers Paper • 2605.15399 • Published May 14
From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing Paper • 2605.15181 • Published May 14 • 10
Consistency Learning via Decoding Path Augmentation for Transformers in Human Object Interaction Detection Paper • 2204.04836 • Published Apr 11, 2022
Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models? Paper • 2508.17536 • Published Aug 24, 2025
Thinking Makes LLM Agents Introverted: How Mandatory Thinking Can Backfire in User-Engaged Agents Paper • 2602.07796 • Published Feb 8 • 7
When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning Paper • 2510.07517 • Published Apr 9
ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation Paper • 2601.02535 • Published Apr 9
Mitigating Selection Bias with Node Pruning and Auxiliary Options Paper • 2409.18857 • Published May 17, 2025
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Paper • 2502.00678 • Published May 20, 2025