Cómo narices hace OpenAI (o Anthropic) para responder a 800 millones de personas a la vez
GPUs de datacenter, redes NVLink, refrigeración líquida y software de serving. Así es como un LLM te responde en 2 segundos mientras lo usan 3 millones de personas más.