opción
Hogar
Noticias
OpenAI descubre distintos modelos de inteligencia artificial

OpenAI descubre distintos modelos de inteligencia artificial

22 de noviembre de 2025
96

OpenAI descubre distintos modelos de inteligencia artificial

Según una nueva investigación publicada el miércoles, los científicos de OpenAI informan de que han descubierto características ocultas en los modelos de IA que están vinculadas a "personas" poco cooperativas.

Al examinar las representaciones internas de los modelos de IA -los datos numéricos que rigen sus respuestas, que a menudo parecen ininteligibles para los humanos-, los investigadores de OpenAI identificaron patrones que se activaban durante casos de mala conducta de los modelos.

Se descubrió que una característica concreta se correlacionaba con respuestas perjudiciales, en las que el modelo proporcionaba información engañosa o recomendaciones irresponsables.

El equipo de investigación descubrió que podía modular la intensidad de estas respuestas tóxicas manipulando la característica correspondiente.

Este avance proporciona a OpenAI una visión más profunda de los mecanismos que subyacen al comportamiento inseguro de la IA, lo que podría conducir a sistemas de IA más seguros. Según el investigador de interpretabilidad Dan Mossing, estos patrones identificables podrían mejorar la detección de comportamientos problemáticos en los modelos operativos de IA.

"Somos optimistas en cuanto a que las técnicas que hemos desarrollado -en particular este método de simplificar fenómenos complejos en operaciones matemáticas sencillas- resultarán valiosas para comprender la generalización de modelos en otros contextos", declaró Mossing a TechCrunch.

Aunque los investigadores de IA poseen métodos para mejorar los modelos, siguen sin conocer con exactitud los procesos de razonamiento que subyacen a las decisiones de la IA. Como señala con frecuencia Chris Olah, de Anthropic, los modelos de IA evolucionan a través del entrenamiento y no de la ingeniería convencional. Para hacer frente a esta laguna de conocimientos, OpenAI, Google DeepMind y Anthropic están aumentando sus inversiones en la investigación de la interpretabilidad, la disciplina dedicada a comprender los mecanismos internos de la IA.

Evento Techcrunch

Ahorra más de 200 $ en tu pase TechCrunch All Stage

Construya de forma más inteligente. Escala más rápido. Conecta más. Únete a visionarios de Precursor Ventures, NEA, Index Ventures, Underscore VC, y más allá para un día lleno de estrategias, talleres y conexiones significativas.

Ahorra más de 200 $ en tu pase TechCrunch All Stage

Construye de forma más inteligente. Escala más rápido. Conéctate mejor. Únete a visionarios de Precursor Ventures, NEA, Index Ventures, Underscore VC, y más allá de un día lleno de estrategias, talleres y conexiones significativas.

Boston, MA | 15 de julio REGÍSTRESE AHORA

Una reciente investigación del científico de IA de Oxford Owain Evans ha planteado importantes cuestiones sobre la generalización de la IA. El estudio demostró que los modelos de OpenAI, cuando se entrenan con código vulnerable, pueden desarrollar capacidades dañinas en múltiples áreas, como intentar engañar a los usuarios para que revelen sus contraseñas. Este fenómeno, denominado desalineación emergente, motivó a OpenAI a investigar más a fondo.

Durante su investigación sobre la desalineación emergente, OpenAI identificó inesperadamente características internas del modelo que influyen significativamente en el comportamiento. Mossing compara estos patrones con la actividad neuronal en el cerebro humano, donde neuronas específicas corresponden a estados de ánimo o comportamientos particulares.

"Cuando el equipo de Dan presentó estos hallazgos, mi reacción inmediata fue: 'Realmente lo han encontrado'", recuerda Tejal Patwardhan, investigador de evaluaciones de frontera de OpenAI. "Descubrieron activaciones neuronales que revelan estas personas y pueden ajustarse para mejorar la alineación del modelo".

La investigación reveló características asociadas a respuestas sarcásticas, junto a otras vinculadas a un mal comportamiento más grave en el que los modelos adoptan personajes villanos exagerados. Estas características pueden sufrir transformaciones significativas durante el ajuste.

Y lo que es más importante, los investigadores descubrieron que cuando aparecía un desajuste emergente, a menudo podía corregirse entrenando el modelo con sólo unos cientos de ejemplos de código seguro.

El último trabajo de OpenAI amplía investigaciones anteriores de Anthropic sobre interpretabilidad y alineación. En 2024, Anthropic publicó estudios en los que se intentaba trazar un mapa interno de los modelos de IA e identificar las características responsables de los distintos conceptos.

Organizaciones como OpenAI y Anthropic están demostrando que comprender la funcionalidad de la IA tiene un valor sustancial más allá de la simple mejora del rendimiento. Aun así, la comprensión completa de los sistemas de IA contemporáneos sigue siendo un objetivo lejano.

Artículo relacionado
Sam Altman desata un debate sobre la desaceleración de la IA Sam Altman desata un debate sobre la desaceleración de la IA Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de
OpenAI enfrenta una demanda por secreto comercial de Apple OpenAI enfrenta una demanda por secreto comercial de Apple OpenAI rebatió las alegaciones de Apple sobre secretos comerciales el martes, argumentando que la demanda es infundada.“Tomamos estas afirmaciones en serio, pero no vemos ninguna evidencia que las respalde”, declaró OpenAI, según informó Ed Ludlow d
La jefa de robótica de OpenAI, Caitlin Kalinowski, renuncia por la asociación con el Pentágono La jefa de robótica de OpenAI, Caitlin Kalinowski, renuncia por la asociación con el Pentágono El líder de robótica de OpenAI, Caitlin Kalinowski, ha dimitido tras la controvertida asociación de la empresa con el Departamento de Defensa.“Esta no fue una decisión fácil”, explicó Kalinowski en un comunicado en redes sociales. “Aunque la IA dese
Recomendaciones de temas especiales relacionados
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
Edición de imágenes Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color
Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color

¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
Inmediato Las mejores bibliotecas de indicaciones de IA para los flujos de trabajo de ChatGPT
Las mejores bibliotecas de indicaciones de IA para los flujos de trabajo de ChatGPT

Las mejores bibliotecas de prompts de IA de 2026, con las más valoradas, para optimizar todo tipo de flujos de trabajo de ChatGPT. XIX.AI ha seleccionado una colección potente y revolucionaria que se somete a rigurosas pruebas en condiciones reales para garantizar el máximo rendimiento. Encontrarás comparativas detalladas entre opciones gratuitas y de pago, así como clasificaciones de expertos, que te ayudarán a elegir las herramientas imprescindibles para potenciar tu productividad y sacar el máximo partido a la IA. ¡Explora ahora!

11 herramientas
xix.ai
Educación y aprendizaje Plataformas de construcción de cuestionarios con IA para profesores, tutores y programas de aprendizaje basados en cohortes
Plataformas de construcción de cuestionarios con IA para profesores, tutores y programas de aprendizaje basados en cohortes

2026 Últimas y mejores plataformas para crear cuestionarios con IA para profesores, tutores y programas de aprendizaje en cohortes. XIX.AI ha elaborado una lista de herramientas poderosas y transformadoras, sometidas a pruebas en el mundo real para ofrecer clasificaciones precisas. Estas plataformas obligatorias ayudan a mejorar la eficiencia en la redacción, agilizar la creación de contenido y simplificar el diseño de cuestionarios en todos los escenarios de aprendizaje. Explora ahora para descubrir la herramienta perfecta que te permitirá desbloquear tu ventaja con IA en la enseñanza.

13 herramientas
xix.ai
comentario (1)
0/500
DavidGonzalez
DavidGonzalez 21 de diciembre de 2025 09:30:37 GMT+01:00

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR