Architectural guidelines for running local LLMs using GGUF and AWQ quantization formats to balance VRAM usage and model precision.