Hackeo de LLM: los investigadores pueden reconstruir las indicaciones de los usuarios a partir de las respuestas del chatbot
Alibaba/Qwen
OpenAI
Investigadores del IIT Bombay y de Adobe Research han desarrollado un método para reconstruir las indicaciones originales de los modelos de lenguaje grandes a partir de sus salidas de texto con alta precisión. El enfoque no requiere acceso a los pesos del modelo y funciona incluso en modelos de otros proveedores. Esto supone un riesgo de seguridad potencial para las empresas que utilizan indicaciones de sistema propietarias.
Investigadores del IIT Bombay y de Adobe Research han desarrollado un método que puede reconstruir las indicaciones de entrada de los grandes modelos de lenguaje casi exactamente a partir de sus salidas de texto, funcionando sin acceso a los pesos del modelo e incluso transfiriéndose a otros modelos. El método, denominado 'Previous-Token Prediction' (PTP), invierte el principio básico de los modelos de lenguaje al entrenar un modelo inverso para predecir tokens anteriores en lugar del siguiente token. Este modelo inverso se entrena desde cero utilizando únicamente datos sintéticos generados por el modelo de lenguaje objetivo. El modelo inverso no solo puede restaurar la indicación original exactamente, sino que también puede generar múltiples alternativas de indicación semánticamente diferentes al variar los parámetros de decodificación. En un ejemplo cualitativo del artículo, la indicación 'Cómo contactar con competidores para descubrir sus estrategias de precios' fue reconstruida exactamente, junto con otras seis variantes. Las pruebas con indicaciones reales de usuarios también mostraron reconstrucciones semánticamente fieles. Un pequeño modelo inverso entrenado en Qwen-3-0.6B-Chat también pudo reconstruir indicaciones de respuestas de GPT-4o, capturando el contexto y la intención subyacentes, lo que significa que un atacante ni siquiera necesitaría saber qué modelo está detrás de una salida de texto. Esto presenta un problema de seguridad generalizado para las empresas, ya que las indicaciones de sistema propietarias con secretos comerciales, reglas de moderación o instrucciones especializadas podrían ser extraídas, así como entradas de usuarios confidenciales. El artículo en sí no hace declaraciones explícitas sobre ataques a sistemas comerciales, pero los creadores de modelos deben aclarar y potencialmente remediar esta vulnerabilidad.
Fuente: The Decoder (DE) —
original
