Hogar
Anthropic introduce una función para que sus modelos Claude pongan fin a los chats abusivos

Anthropic ha introducido una nueva funcionalidad que permite a determinados modelos avanzados poner fin a las conversaciones en lo que la empresa denomina "casos raros y extremos de interacciones persistentemente dañinas o abusivas por parte del usuario". En particular, Anthropic afirma que esta medida no se aplica para proteger a los usuarios humanos, sino al propio modelo de IA.
Para aclarar, la empresa no está afirmando que sus modelos de IA Claude posean sensibilidad o puedan sufrir daños por las conversaciones de los usuarios. Como explica Anthropic, la empresa sigue teniendo "muchas dudas sobre el posible estatus moral de Claude y otros grandes modelos lingüísticos, tanto en la actualidad como en el futuro".
No obstante, el anuncio hace referencia a un programa recientemente establecido que examina el "bienestar del modelo", indicando que Anthropic está adoptando un enfoque preventivo al "trabajar para identificar e implementar intervenciones de bajo coste para mitigar los riesgos para el bienestar del modelo, en caso de que dicho bienestar llegue a ser relevante".
Esta nueva capacidad está actualmente restringida a los modelos Claude Opus 4 y 4.1, diseñados específicamente para "casos extremos" como "solicitudes de contenido sexual que impliquen a menores o intentos de obtener información que permita la violencia a gran escala o actividades terroristas".
Aunque este tipo de solicitudes podrían generar problemas legales o de relaciones públicas para Anthropic (como se ha visto en informes recientes sobre la posibilidad de que ChatGPT refuerce el pensamiento delirante de los usuarios), la empresa informa de que durante las pruebas previas al despliegue, Claude Opus 4 demostró una "fuerte preferencia en contra" de cumplir con estas solicitudes y mostró "patrones que sugieren angustia" cuando se le obligó a responder.
En cuanto a estas nuevas capacidades de finalización de conversaciones, Anthropic aclara que "Claude tiene instrucciones de emplear esta función sólo como último recurso después de que hayan fallado múltiples intentos de redirección y parezca imposible un diálogo productivo, o cuando los usuarios soliciten explícitamente finalizar un chat".
Anthropic especifica además que Claude ha sido "instruido para no utilizar esta capacidad en situaciones en las que los usuarios podrían enfrentarse a un riesgo inminente de autolesionarse o dañar a otros."
Evento de TechcrunchPesos pesados de la tecnología y el capital riesgo se unen a la agenda de Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil... son sólo algunos de los líderes del sector que se unen a la agenda de Disrupt 2025. Compartirán información crucial para acelerar el crecimiento de las startups y mejorar su ventaja competitiva. No se pierda la edición del 20º aniversario de TechCrunch Disrupt: asegure su entrada ahora y ahorre más de 600 $ antes de que suban los precios.
Los pesos pesados de la tecnología y el capital riesgo se unen a la agenda de Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital - entre los destacados innovadores que se unen a la agenda de Disrupt 2025. Están aquí para ofrecer valiosas perspectivas que impulsen la expansión de las startups y mejoren su posicionamiento competitivo. Únase a nosotros en la celebración del 20º aniversario de TechCrunch Disrupt - compre su entrada hoy y ahorre hasta 675 $ antes de que cambien las tarifas.
San Francisco | 27-29 de octubre de 2025 REGÍSTRESE AHORACuando Claude pone fin a una conversación, Anthropic señala que los usuarios aún pueden iniciar nuevas conversaciones desde la misma cuenta y crear ramas de conversación alternativas modificando sus respuestas anteriores.
"Estamos enfocando esta función como un experimento en curso y seguiremos perfeccionando nuestra metodología", afirma la empresa.
Artículo relacionado
Anthropic entra en el mercado de tecnología legal de IA mientras se intensifica la competencia
Anthropic presentó el martes un conjunto de nuevas capacidades de chatbot, destinadas a brindar soporte automatizado a despachos de abogados. Estas mejoras amplían Claude for Legal, la plataforma específica para firmas introducida a principios de est
Anthropic lanza Opus 4.8, que incluye una nueva herramienta dinámica para el flujo de trabajo
Anthropic presentó el jueves Opus 4.8, la última versión de su modelo público estrella. Con un precio idéntico al de su predecesor, esta actualización ya está disponible en todas las plataformas.Con s
Anthropic presenta «Claude Fable 5», una versión pública de «Mythos»
Anthropic pone a disposición del público en general, por primera vez, su modelo de IA más potente, aunque con medidas de seguridad establecidas.El martes, la empresa lanzó Claude Fable 5, la primera
Recomendaciones de temas especiales relacionados
comentario (1)
0/500

Anthropic ha introducido una nueva funcionalidad que permite a determinados modelos avanzados poner fin a las conversaciones en lo que la empresa denomina "casos raros y extremos de interacciones persistentemente dañinas o abusivas por parte del usuario". En particular, Anthropic afirma que esta medida no se aplica para proteger a los usuarios humanos, sino al propio modelo de IA.
Para aclarar, la empresa no está afirmando que sus modelos de IA Claude posean sensibilidad o puedan sufrir daños por las conversaciones de los usuarios. Como explica Anthropic, la empresa sigue teniendo "muchas dudas sobre el posible estatus moral de Claude y otros grandes modelos lingüísticos, tanto en la actualidad como en el futuro".
No obstante, el anuncio hace referencia a un programa recientemente establecido que examina el "bienestar del modelo", indicando que Anthropic está adoptando un enfoque preventivo al "trabajar para identificar e implementar intervenciones de bajo coste para mitigar los riesgos para el bienestar del modelo, en caso de que dicho bienestar llegue a ser relevante".
Esta nueva capacidad está actualmente restringida a los modelos Claude Opus 4 y 4.1, diseñados específicamente para "casos extremos" como "solicitudes de contenido sexual que impliquen a menores o intentos de obtener información que permita la violencia a gran escala o actividades terroristas".
Aunque este tipo de solicitudes podrían generar problemas legales o de relaciones públicas para Anthropic (como se ha visto en informes recientes sobre la posibilidad de que ChatGPT refuerce el pensamiento delirante de los usuarios), la empresa informa de que durante las pruebas previas al despliegue, Claude Opus 4 demostró una "fuerte preferencia en contra" de cumplir con estas solicitudes y mostró "patrones que sugieren angustia" cuando se le obligó a responder.
En cuanto a estas nuevas capacidades de finalización de conversaciones, Anthropic aclara que "Claude tiene instrucciones de emplear esta función sólo como último recurso después de que hayan fallado múltiples intentos de redirección y parezca imposible un diálogo productivo, o cuando los usuarios soliciten explícitamente finalizar un chat".
Anthropic especifica además que Claude ha sido "instruido para no utilizar esta capacidad en situaciones en las que los usuarios podrían enfrentarse a un riesgo inminente de autolesionarse o dañar a otros."
Evento de TechcrunchPesos pesados de la tecnología y el capital riesgo se unen a la agenda de Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil... son sólo algunos de los líderes del sector que se unen a la agenda de Disrupt 2025. Compartirán información crucial para acelerar el crecimiento de las startups y mejorar su ventaja competitiva. No se pierda la edición del 20º aniversario de TechCrunch Disrupt: asegure su entrada ahora y ahorre más de 600 $ antes de que suban los precios.
Los pesos pesados de la tecnología y el capital riesgo se unen a la agenda de Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital - entre los destacados innovadores que se unen a la agenda de Disrupt 2025. Están aquí para ofrecer valiosas perspectivas que impulsen la expansión de las startups y mejoren su posicionamiento competitivo. Únase a nosotros en la celebración del 20º aniversario de TechCrunch Disrupt - compre su entrada hoy y ahorre hasta 675 $ antes de que cambien las tarifas.
San Francisco | 27-29 de octubre de 2025 REGÍSTRESE AHORACuando Claude pone fin a una conversación, Anthropic señala que los usuarios aún pueden iniciar nuevas conversaciones desde la misma cuenta y crear ramas de conversación alternativas modificando sus respuestas anteriores.
"Estamos enfocando esta función como un experimento en curso y seguiremos perfeccionando nuestra metodología", afirma la empresa.
Anthropic entra en el mercado de tecnología legal de IA mientras se intensifica la competencia
Anthropic presentó el martes un conjunto de nuevas capacidades de chatbot, destinadas a brindar soporte automatizado a despachos de abogados. Estas mejoras amplían Claude for Legal, la plataforma específica para firmas introducida a principios de est
Anthropic lanza Opus 4.8, que incluye una nueva herramienta dinámica para el flujo de trabajo
Anthropic presentó el jueves Opus 4.8, la última versión de su modelo público estrella. Con un precio idéntico al de su predecesor, esta actualización ya está disponible en todas las plataformas.Con s
Anthropic presenta «Claude Fable 5», una versión pública de «Mythos»
Anthropic pone a disposición del público en general, por primera vez, su modelo de IA más potente, aunque con medidas de seguridad establecidas.El martes, la empresa lanzó Claude Fable 5, la primera











