EPISODE · Apr 26, 2025 · 17 MIN
NoWag: Unified Compression for Large Language Models
from Best AI papers explained · host Enoch H. Kang
We discuss NoWag, a novel framework for compressing large language models (LLMs) while preserving their structure. This unified approach, encompassing both pruning (removing less important connections) and vector quantization (grouping and reducing the precision of weights), uses a normalization technique guided by weight and activation data. Experiments on Llama models demonstrate that NoWag significantly outperforms existing state-of-the-art zero-shot quantization methods with less data and achieves competitive results in pruning, suggesting a shared underlying principle for effective LLM compression.
Embed this episode
NOW PLAYING
NoWag: Unified Compression for Large Language Models
No transcript for this episode yet
Similar Episodes
No similar episodes found.