dorsal/arxiv
View SchemaInference-Time Scaling for Visual AutoRegressive modeling by Searching Representative Samples
| Authors | Weidong Tang, Xinyan Wan, Siyu Li, Xiumei Wang |
|---|---|
| Categories | |
| ArXiv ID | 2601.07293vv1 |
| URL | https://arxiv.org/abs/2601.07293 |
| DOI | 10.1007/978-981-95-5699-1_28 |
| License | http://creativecommons.org/licenses/by/4.0/ |
Abstract
While inference-time scaling has significantly enhanced generative quality in large language and diffusion models, its application to vector-quantized (VQ) visual autoregressive modeling (VAR) remains unexplored. We introduce VAR-Scaling, the first general framework for inference-time scaling in VAR, addressing the critical challenge of discrete latent spaces that prohibit continuous path search. We find that VAR scales exhibit two distinct pattern types: general patterns and specific patterns, where later-stage specific patterns conditionally optimize early-stage general patterns. To overcome the discrete latent space barrier in VQ models, we map sampling spaces to quasi-continuous feature spaces via kernel density estimation (KDE), where high-density samples approximate stable, high-quality solutions. This transformation enables effective navigation of sampling distributions. We propose a density-adaptive hybrid sampling strategy: Top-k sampling focuses on high-density regions to preserve quality near distribution modes, while Random-k sampling explores low-density areas to maintain diversity and prevent premature convergence. Consequently, VAR-Scaling optimizes sample fidelity at critical scales to enhance output quality. Experiments in class-conditional and text-to-image evaluations demonstrate significant improvements in inference process. The code is available at https://github.com/WD7ang/VAR-Scaling.
{
"annotation_id": "324d69ed-e05a-4792-8753-11364cee5134",
"date_created": "2026-02-17T05:53:12.655000Z",
"date_modified": "2026-02-17T05:53:12.655000Z",
"file_hash": "649e3b9edc275b8f04b323718c75c7f439bf84eb6be70d295c48aa729015bcfb",
"private": false,
"record": {
"abstract": "While inference-time scaling has significantly enhanced generative quality in large language and diffusion models, its application to vector-quantized (VQ) visual autoregressive modeling (VAR) remains unexplored. We introduce VAR-Scaling, the first general framework for inference-time scaling in VAR, addressing the critical challenge of discrete latent spaces that prohibit continuous path search. We find that VAR scales exhibit two distinct pattern types: general patterns and specific patterns, where later-stage specific patterns conditionally optimize early-stage general patterns. To overcome the discrete latent space barrier in VQ models, we map sampling spaces to quasi-continuous feature spaces via kernel density estimation (KDE), where high-density samples approximate stable, high-quality solutions. This transformation enables effective navigation of sampling distributions. We propose a density-adaptive hybrid sampling strategy: Top-k sampling focuses on high-density regions to preserve quality near distribution modes, while Random-k sampling explores low-density areas to maintain diversity and prevent premature convergence. Consequently, VAR-Scaling optimizes sample fidelity at critical scales to enhance output quality. Experiments in class-conditional and text-to-image evaluations demonstrate significant improvements in inference process. The code is available at https://github.com/WD7ang/VAR-Scaling.",
"arxiv_id": "2601.07293",
"authors": [
"Weidong Tang",
"Xinyan Wan",
"Siyu Li",
"Xiumei Wang"
],
"categories": [
"cs.CV"
],
"doi": "10.1007/978-981-95-5699-1_28",
"license": "http://creativecommons.org/licenses/by/4.0/",
"title": "Inference-Time Scaling for Visual AutoRegressive modeling by Searching Representative Samples",
"url": "https://arxiv.org/abs/2601.07293",
"version": "v1"
},
"schema_id": "dorsal/arxiv",
"source": {
"execution_id": "79c1dac3-ca2d-4b76-9db4-0e260e929c1e",
"id": "arXiv Dataset",
"type": "Model",
"variant": "snapshot-2026-01-17",
"version": "0.1.0"
},
"user_id": 1000002
}