Alex Open Research Wiki
Search
Search
Dark mode
Light mode
Explorer
Tag: inference-efficiency
14 items with this tag.
Sep 09, 2026
Skip a Layer or Loop It? Learning Program-of-Layers in LLMs
large-language-models
adaptive-compute
layer-routing
recurrent-depth
dynamic-compute
test-time-compute
inference-efficiency
Aug 31, 2026
Sparse-LaViDa
entity
masked-diffusion
sparse-decoding
inference-efficiency
Aug 31, 2026
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
diffusion-language-models
vision-language-models
masked-diffusion
multimodal-understanding
inference-efficiency
Aug 31, 2026
Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
diffusion-language-models
unified-multimodal-models
masked-diffusion
kv-cache
sparse-decoding
inference-efficiency
Aug 31, 2026
Diffusion Language Models
diffusion-language-models
language-modeling
generation
inference-efficiency
Jul 17, 2026
DMax
entity
diffusion-language-models
parallel-decoding
inference-efficiency
self-distillation
Jul 17, 2026
DMax: Aggressive Parallel Decoding for dLLMs
diffusion-language-models
parallel-decoding
self-distillation
inference-efficiency
post-training
Jul 17, 2026
Gated Delta Networks: Improving Mamba2 with Delta Rule
linear-attention
recurrent-state
state-space-models
long-context
inference-efficiency
hybrid-models
Jul 17, 2026
A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
linear-attention
recurrent-state
exact-memory
kv-cache
associative-recall
long-context
inference-efficiency
Jul 17, 2026
Hybrid Associative Memories
hybrid-models
associative-memory
recurrent-state
kv-cache
long-context
inference-efficiency
Jul 17, 2026
Improved Large Language Diffusion Models
diffusion-language-models
masked-diffusion
bidirectional-attention
inference-efficiency
llm-post-training
Jun 30, 2026
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
linear-attention
recurrent-state
state-space-models
long-context
inference-efficiency
Jun 30, 2026
Multi-Mixer Models: Flexible Sequence Modeling with Shared Representations
hybrid-models
long-context
recurrent-state
attention
inference-efficiency
fixed-flops
May 18, 2026
Mamba-3: Improved Sequence Modeling using State Space Principles
sequence-models
state-space-models
recurrent-models
inference-efficiency
language-modeling