John Schulman, cofundador de OpenAI que ahora se desempeña como científico jefe en Thinking Machines, dijo que espera una mejora personal recursiva (sistemas de IA que aceleren su propio desarrollo) en aproximadamente tres o cuatro años, un cronograma que lo coloca entre los pronosticadores más agresivos en el campo. Schulman dio la estimación durante un episodio de mesa redonda del Dwarkesh Podcast publicado el viernes, en el que tres investigadores de laboratorios fronterizos debatieron abiertamente qué tan cerca está realmente la industria de su techo.

La conversación ofreció una rara mirada despreocupada a cómo los investigadores cercanos a la frontera están pensando sobre el progreso, y llegó en medio de una semana ruidosa en la que el CEO de Nvidia, Jensen Huang, declaró que "AGI ha llegado" y un grupo de 25 medallistas Fields advirtieron que la búsqueda de puntos de referencia de IA está dañando las matemáticas. Para los lectores que siguen los últimos desarrollos de IA, el episodio es un contrapeso útil: se trata de personas que construyen los sistemas y no están de acuerdo entre sí.

¿Quién estaba en la mesa?

El presentador Dwarkesh Patel dijo que reunió el panel porque los invitados trabajan en lo que él llamó "laboratorios y empresas algo abiertos", lo que significa que podían hablar oficialmente. Junto a Schulman se encontraban Beren Millidge, directora de tecnología de Zyphra, una startup que desarrolla modelos de código abierto, y Charlie O'Neill, jefe de capacitación de modelos en Baseten.

Las credenciales de Schulman dan un peso particular a su discurso sobre la línea del tiempo. Cofundó OpenAI y dirigió el aprendizaje reforzado a partir de la investigación de la retroalimentación humana que produjo las técnicas detrás de ChatGPT, antes de partir hacia Thinking Machines, donde ahora se desempeña como científico jefe.

El caso contra la singularidad, Steelmanned

Patel comenzó con una pregunta directa: si llega 2036 sin miles de millones de sistemas superinteligentes que transformen el mundo, ¿cuál habrá sido la razón técnica? Milidge ofreció el caso más sólido para el escepticismo, describiendo lo que llamó un patrón casi al estilo de la paradoja de Moravec en el que los modelos superan cualquier punto de referencia que los investigadores les pongan delante, pero el impacto en el mundo real decepciona.

"Todavía existe una brecha persistente entre simulación y real que de alguna manera está bloqueando todo", dijo Millidge, describiendo un mundo donde la IA se vuelve "extremadamente buena en todo lo que la gente pone como punto de referencia" sin generalizar más. Añadió que considera que este resultado es poco probable y señala la evidencia de que el aprendizaje por refuerzo ya se generaliza en la práctica.

Schulman coincidió en gran medida en que el progreso no es automático. Los seres humanos tienen ventajas reales sobre los modelos actuales, dijo, y cada nuevo modelo lanzado se pone al día en algunas áreas mientras permanece estancado en otras: el patrón que ha definido los últimos ciclos de productos.

Cronogramas rápidos: dos años, de tres a cuatro, de cinco a diez

Cuando Patel presionó para obtener números, el panel se dividió. Cuando se le preguntó cuándo la IA podría multiplicar por diez la productividad de un trabajador administrativo competente, Schulman primero se negó a dar una sola cifra y luego dijo: "Yo diría que dos años". Millidge dijo que "podía ver eso, en realidad", argumentando que la ganancia ya excede 10 veces para algunas categorías de trabajo. O'Neill fue el más conservador y respondió "5 a 10" años.

Patel luego fue más allá y caracterizó el escenario como "básicamente sólo ASI". La respuesta de Schulman: "Yo diría que entre 3 y 4 años", y agregó que la automatización de la investigación de la IA en sí "no es una de las cosas más difíciles para la IA, porque implica mucho" trabajo que las técnicas actuales ya pueden abordar. El intercambio fue notable por el poco rechazo que la estimación generó por parte de los otros investigadores.

Cómo se capacitarían realmente a los investigadores automatizados

Una parte sustancial del episodio abordó la mecánica del escenario que Schulman estaba valorando. Cuando se le preguntó cómo se entrenarían los sistemas de IA capaces de automatizar la investigación de IA, Schulman describió "una combinación de aprendizaje de la retroalimentación humana para absorber el gusto de los investigadores, y simplemente crear una gran cantidad de entornos de práctica que implican realizar investigaciones de varios pasos".

Esa respuesta se relaciona con el destino del dinero de la industria. El acuerdo recientemente cerrado por Google para Mechanize, una startup que construye entornos de trabajo simulados para agentes de capacitación, refleja exactamente esta apuesta de que mejores campos de capacitación -no sólo modelos más grandes- impulsarán la próxima ronda de ganancias de capacidad. Schulman también señaló una dificultad central: las funciones de recompensa basadas en datos naturales son difíciles de especificar, y las señales superficiales, como si un usuario aceptó una edición de código, pueden inducir a error en la capacitación.

Destilación versus centralización

Una de las predicciones más concretas de Schulman se refería a la estructura industrial. "Creo que la destilación es lo principal que lucha contra la fuerza centralizadora", dijo, argumentando que las capacidades aprendidas a través del aprendizaje por refuerzo pueden transferirse a modelos más pequeños con relativa facilidad, extendiendo la competencia adyacente más allá de las pocas empresas que pueden permitirse carreras de capacitación en la frontera.

Sobre la cuestión de qué queda para los humanos, Schulman fue categórico. "Yo diría que el último trabajo de los humanos, o el papel que durará más tiempo para los humanos, es definir el objetivo y decidir lo que realmente queremos", dijo. Cuando Patel resumió que "la alineación es el trabajo final", Schulman coincidió: "La alineación es una especie de respuesta", aunque señaló que se descompone en descubrir el objetivo correcto y luego lograrlo.

Dónde encaja el episodio en el debate sobre la línea de tiempo

El subtítulo del episodio - "No estamos ni cerca del techo" - captura su tenor general: investigadores que ven una pista sustancial por delante, incluso cuando discuten cuán accidentado será el camino. La discusión abarcó qué está impulsando el progreso de los laboratorios chinos, si el aprendizaje por refuerzo a largo plazo puede generar inteligencia general y por qué RL ha comenzado a funcionar tan bien.

El debate público sobre los plazos se ha intensificado en todas partes este mes. La proclamación de Huang "AGI ha llegado" generó escepticismo entre los analistas que la leyeron como un caso de negocios en lugar de una afirmación científica, mientras que el CEO de OpenAI, Sam Altman, dijo al personal que la compañía está abierta a desacelerar el desarrollo de vanguardia a medida que aumentan las preocupaciones de seguridad, según Bloomberg. La ventana de tres a cuatro años de Schulman para la superación personal recursiva se sitúa en algún lugar entre el marketing y la moratoria: una estimación de trabajo de alguien con un historial en el desarrollo de las técnicas que ahora impulsan el campo.

Si tiene razón dependerá de las preguntas que el panel simplemente circuló: si el aprendizaje por refuerzo sigue generalizándose más allá de sus entornos de capacitación y si la brecha entre el desempeño de referencia y el valor económico real continúa cerrándose.

Manténgase por delante de la IA

Los investigadores de Frontier están debatiendo en público los límites de la IA; siga la historia a medida que se desarrolla.

Lea más noticias sobre IA en AI Buzz Wire