La empresa de inteligencia artificial Anthropic informó el hallazgo de un nuevo espacio interno de procesamiento en sus modelos, denominado J-space, una estructura que habría surgido de manera emergente durante el entrenamiento de los sistemas y que no fue diseñada explícitamente por sus desarrolladores.
Según la compañía, este espacio funciona de forma paralela al razonamiento que el modelo muestra en sus respuestas. Durante distintas pruebas, los investigadores observaron que la inteligencia artificial resolvía operaciones sin exponer los pasos intermedios al usuario, aunque esos procesos sí quedaban representados dentro del denominado J-space.
Los experimentos también evidenciaron que el modelo era capaz de mantener conceptos activos internamente, aun cuando estos no aparecieran en el razonamiento visible ni en la respuesta final. Este comportamiento sugiere la existencia de mecanismos internos de procesamiento que hasta ahora permanecían fuera del alcance de los investigadores.
Anthropic explicó que el descubrimiento podría contribuir a comprender con mayor precisión cómo procesan información los modelos de inteligencia artificial y cuáles son las etapas internas que intervienen en la generación de sus respuestas.
La empresa estima que esta línea de investigación podría facilitar el desarrollo de herramientas para detectar cuándo un modelo oculta información relevante, genera contenidos incorrectos o presenta comportamientos engañosos, fortaleciendo así la transparencia, la supervisión y la seguridad de los sistemas de inteligencia artificial. (NP-ChatGPT-Jon Hernández)
