En abril de 2023, cuando ChatGPT acababa de ver la luz, un grupo de ingenieros que trabajaban en la división de semiconductores de Samsung pegó código fuente confidencial en esta IA para que detectara errores. Además, uno de ellos aprovechó la ocasión para ahorrar tiempo y le cargó una minuta completa de una reunión directiva, para que generara un resumen. ¿El problema? Toda esa información corporativa ultra confidencial terminó alojada en los servidores de OpenAI y disponible para el entrenamiento de su modelo. La compañía no lo dudó y tomó medidas drásticas: prohibió temporalmente el uso de herramientas de IA generativa en todas sus redes internas. El caso de Samsung sigue dándose hoy en muchas industrias, empresas y emprendimientos, muchas veces sin que los autores sean conscientes de lo que están haciendo.
“El riesgo no es un hacker ruso atravesando tu barrera de seguridad a medianoche; hoy la principal fuga de información son empleados con buenas intenciones usando herramientas públicas para trabajar más rápido“, fue contundente Marcelo De Luca, cofundador de The App Master, compañía argentina que crea soluciones tecnológicas para startups, pequeñas y medianas empresas.Para recuperar el control del cuerpo. Antes que Neuralink, China aprueba su primer chip cerebral para su uso médico
Efectivamente, pocos saben que cuando se utiliza una inteligencia artificial, el modelo lee el prompt y la información para brindar una respuesta en el momento, pero también ocurre algo más: esos datos se guardan en sus servidores -en muchos casos- para seguir “entrenando” el sistema.
¿Qué significa esto en la práctica? “Que si le subís un balance, una estrategia de ventas o el código de tu sistema, todo eso entra en una gran bolsa de aprendizaje. Mañana, si un competidor tuyo le hace la pregunta correcta a esa misma IA, el sistema podría usar lo que aprendió con tus datos para responderle a él”, advirtió De Luca, aunque señaló que esto no se da en todos los escenarios: “A menos que pagues versiones corporativas donde te firman que no van a usar tu información”.

Pero a veces pagar no es sinónimo de privacidad: es necesario desactivar manualmente esto en el caso de cuentas personales (especificar que no se desea usar los datos para el entrenamiento), contar con una versión corporativa o utilizarlo a través de API (conectores específicos para software). “En las versiones gratuitas y abiertas al público masivo, la regla general establecida por los proveedores es la reserva del derecho a incorporar las consultas y las respuestas para perfeccionar sus algoritmos. Por el contrario, cuando se opera mediante suscripciones corporativas, entornos dedicados o accesos por interfaz de programación de aplicaciones, los contratos estipulan cláusulas explícitas donde los datos son excluidos de los esquemas de reentrenamiento”, sintetizó el Ing. Sergio Aguilera, director de Carreras de Informática de la Universidad de Belgrano.
Lo inquietante es que se trata de términos y condiciones que muchas veces no se aclaran -o por lo menos no de forma evidente-, aunque esto puede variar según la legislación vigente en cada jurisdicción. Jorge Litvin, especialista en riesgos de ciberseguridad, fundador y CEO de la empresa Safe-U, señaló que, en Europa, por ejemplo, la regulación exige una aviso previo y un derecho de oposición fácil de ejecutar. “El resultado es que algunos proveedores directamente excluyen del entrenamiento a los usuarios europeos y otros los dejan oponerse antes de empezar”, explicó y agregó: “En la Argentina no existe una obligación equivalente: acá el usuario no tiene garantizado por ley ni el aviso ni la opción, depende de lo que cada empresa decida ofrecerle”.
LA NACION también consultó a las empresas detrás de las herramientas de IA más populares acerca de cuándo y cómo utilizan los datos de los usuarios para entrenar sus modelos. “En cuentas personales, si el usuario mantiene activada la función de «Actividad» en las aplicaciones con Gemini, las interacciones pueden utilizarse para mejorar los productos de Google«, respondieron desde la tecnológica, aunque aclararon que “los datos se desvinculan de la cuenta del usuario y se anonimizan antes de cualquier revisión. Si el usuario desactiva el historial, sus nuevas consultas no se guardan ni se usan para entrenar modelos”. Vale agregar que, al hacer la prueba e intentar desactivar la función “Actividad”, la empresa aclara varias condiciones más, entre las que figuran que “algunas apps conectadas no están disponibles cuando este parámetro de configuración está desactivado”.
En el caso de cuentas corporativas: en productos empresariales como Google Workspace o Google Cloud, la empresa aseguró que “la información (correos, documentos, consultas o respuestas) nunca se utiliza para entrenar los modelos públicos de IA de Google ni de terceros. Los datos pertenecen exclusivamente a la empresa, están aislados en su perímetro de seguridad y cuentan con protección de grado empresarial, asegurando que no se utilicen para entrenar modelos externos ni para perfiles publicitarios”.
OpenAI no respondió a las consultas que se le hicieron en relación al tratamiento de la información.
¿Qué no deberías compartir nunca con una IA?
Pablo Lima, director de ventas para el sur de América Latina de la empresa VU, dedicada a la ciberseguridad, señaló que, siempre que la información sea de terceros, confidencial o estratégica es recomendable pensar cuidadosamente si conviene o no compartir los datos con el modelo de IA. “Conviene detenerse antes de ingresar datos de clientes, empleados, pacientes o proveedores; documentos internos, contratos, código fuente, resultados financieros no publicados o cualquier información protegida por un acuerdo de confidencialidad”, explicó Lima y advirtió que también importa el uso que se le da a la IA: “No es lo mismo pedir ayuda para redactar un texto genérico que cargar una base de datos completa para analizarla. Una regla simple que puede servir consiste en que, si esa misma información no se la enviarías sin problema a un proveedor externo desconocido, tampoco deberías cargarla en una herramienta de IA sin los controles y las garantías contractuales adecuadas”.
Fuenete: La Nación

Sea el primero en comentar en "Manual de IA: qué información nunca deberías compartir con una inteligencia artificial"