Reduce LLM size and accelerate inference using pruning techniques like Wanda and SparseGPT. Use when compressing models without retraining, achieving 50% sparsity with minimal accuracy loss, or enabli
airesearch_skills/19-emerging-techniques/model-pruning/SKILL.md(main)