Google ha llevado dos modelos a disponibilidad general: gemini-3.6-flash y gemini-3.5-flash-lite. Ambos son ahora endpoints estables en lugar de versiones preliminares.

Qué ha cambiado

Gemini 3.6 Flash llega con una eficiencia de tokens mejorada y una planificación de código y de agentes más sólida, a un precio más bajo que el modelo al que sustituye. La afirmación sobre la eficiencia de tokens importa más de lo que parece: en ejecuciones agénticas largas, la factura la determina cuántos tokens dedica el modelo a razonar, no el precio por millón que figura en la etiqueta.

Gemini 3.5 Flash-Lite se posiciona como una opción de subagente de baja latencia y bajo coste: el modelo al que se llama miles de veces dentro de un sistema más grande, en lugar de aquel con el que interactúa directamente el usuario.

El cambio disruptivo

Junto con la disponibilidad general llega un cambio que romperá el código existente: los parámetros de muestreo temperature, top_p y top_k quedan obsoletos para ambos modelos. El código que los utiliza necesita revisión. Se trata de un giro real de postura: esos tres controles han sido estándar en las API generativas desde el principio, y eliminarlos significa que el modelo decide por sí mismo su comportamiento de muestreo.

Por qué importa

Eliminar los controles de muestreo cambia el ajuste por parte del usuario por control del proveedor. Para la mayoría de las aplicaciones los valores predeterminados ya funcionaban bien, y tener menos controles significa menos formas de configurar mal un despliegue. Para los equipos que dedicaron un esfuerzo real a ajustar la temperature según el caso de uso, ese trabajo ahora queda obsoleto.

Cabe destacar la ausencia en este lanzamiento de Gemini 3.5 Pro, que ya ha superado varias ventanas previstas. Google ha lanzado el nivel rápido y económico y ha dejado el modelo insignia para más adelante.

Qué hacer al respecto

Audite cualquier ruta de código que establezca temperature, top_p o top_k con estos dos modelos y planifique su eliminación. La obsolescencia no es una eliminación inmediata, pero sí un compromiso, y los parámetros ignorados silenciosamente son peores que los errores: la salida cambia y nada le indica por qué.

Cuando el determinismo realmente importa, el reemplazo es estructural en lugar de paramétrico: restrinja el formato de salida, valide lo que se devuelve y reintente en caso de fallo. Ese enfoque sobrevive a las actualizaciones de modelos de una forma en que un valor de temperature ajustado nunca lo hizo.

El patrón entre proveedores

Google no está solo en esto. La industria ha ido eliminando de forma constante los controles de bajo nivel en favor de modelos que gestionan su propio comportamiento de inferencia, y los modelos de razonamiento ya habían vuelto irrelevantes la mayoría de los ajustes de muestreo. Cabe esperar que la superficie de estas API siga reduciéndose.