Cómo usar la IA con datos que no puedes pegar en ChatGPT

Tres formas reales de que la IA te ayude con archivos confidenciales, y la pregunta sobre tus propias normas que decide cuál te conviene.

IA y sociedad · 2026-09-06

Tu empresa ha trazado una línea que muchas otras trazaron este año : no pegar registros de clientes ni documentos internos en ChatGPT ni en ninguna otra herramienta de IA de uso público. El miedo es razonable, y también lo es el deseo de mayor productividad que la gente sigue pidiendo. La buena noticia que dejó una conversación reciente en Polora, en la que cinco modelos de IA asumieron cada uno un papel distinto y trabajaron sobre esta misma pregunta, es que la elección no se reduce a usar el ChatGPT público o construirlo todo por tu cuenta. Existen tres caminos verdaderamente distintos, y acertar empieza por una pregunta sobre tus propias normas, no sobre la tecnología.

Primero, decide qué prohíbe en realidad tu norma

El punto en el que más coincidió la conversación fue que las empresas suelen confundir dos normas muy diferentes. Una dice que un proveedor no puede guardar tus consultas ni usarlas para mejorar sus modelos públicos. Otra, más estricta, dice que ninguna empresa externa puede ver ni conservar tu texto en claro, prometa lo que prometa un contrato. La asesora de cumplimiento del panel llamó a esto el riesgo de entrenamiento y el riesgo de procesamiento por terceros, y señaló que no entregar datos a un tercero es una exigencia mucho más alta que no entrenar con ellos. Cuál de las dos exige en realidad tu política es lo que decide todo lo que viene después. Así que el primer paso no es buscar software. Es preguntar a tus equipos legal y de seguridad qué línea trazaron en realidad.

Camino uno : un plan de empresa que promete no entrenar con tus datos

La opción más ligera es un plan de empresa de pago de un proveedor grande de IA, usado bajo un contrato firmado y no con una cuenta de consumidor. El argumento de la asesora fue que la promesa vive en la orden de pedido y en el acuerdo de tratamiento de datos, no en la página de marketing : nada de entrenar con tu contenido, cifrado, un periodo de conservación definido, ubicación de los datos, una lista con los nombres de los subcontratistas, e inicio de sesión corporativo con registros de auditoría. El especialista en infraestructura describió esta vía como la más rápida y la que menos esfuerzo exige, ya que el proveedor opera el modelo y tu personal solo tiene que iniciar sesión.

El investigador que verificó estas afirmaciones añadió una advertencia que conviene guardar. OpenAI, por ejemplo, declara que las entradas de sus planes business y enterprise no se usan para entrenar sus modelos de forma predeterminada, pero la conservación cero solo se ofrece a clientes que cumplen ciertos requisitos y varía según el producto y la región. Eso hay que confirmarlo en tu propio contrato, no darlo por hecho a partir de la marca empresarial de un proveedor.

Camino dos : tu propia nube, y por qué sigue siendo la nube de otro

El camino intermedio ejecuta un modelo de pesos abiertos, como Llama de Meta o Qwen de Alibaba, dentro de la propia cuenta de tu empresa en AWS, Azure o Google. Tus archivos permanecen dentro del perímetro de tu red, y la empresa que construyó el modelo nunca los ve. Varios participantes lo propusieron como la respuesta cuando la norma prohíbe los servicios de IA externos pero ya se confía en tu proveedor de nube actual.

El investigador matizó una exageración frecuente. Un modelo que corre en tu cuenta de nube no elimina el procesamiento por terceros. Según la mayoría de las definiciones de privacidad, el proveedor de nube sigue siendo un encargado del tratamiento, y la propia guía de AWS describe sus controles de red privada como algo que reduce la exposición, no que ponga fin a esa relación. Si tu norma prohíbe de verdad a cualquier encargado externo, este camino no la cumple.

※ modelo de pesos abiertos : un modelo de IA cuyos ajustes internos están publicados, de modo que cualquiera puede descargarlo y ejecutarlo en sus propias máquinas en lugar de usarlo solo a través de la web de su fabricante.

Camino tres : tu propio hardware, el máximo control y el máximo trabajo

El camino más estricto compra servidores físicos y ejecuta el modelo por completo dentro de tu edificio, sin ninguna conexión externa. Es la única disposición que puede afirmar con honestidad que ninguna empresa externa toca los datos, y el panel coincidió en que encaja con el trabajo de defensa, los entornos aislados de la red o los contratos que prohíben cualquier procesamiento externo.

Fueron tajantes en que esto no es una compra, sino un servicio que tienes que operar : hardware, energía, refrigeración, parches de seguridad, copias de respaldo y personas que lo mantengan vivo. El juez advirtió que una empresa sin ingenieros de IA puede convertir esto en un problema informático abandonado, y que un modelo descargado es solo el motor, nunca el producto terminado.

※ aislados de la red : mantenidos físicamente desconectados de internet y de las redes externas, de modo que los datos no tienen ninguna salida de la máquina.

Los tres caminos para usar IA con datos que no puedes pegar en herramientas públicas. · Camino uno La opción más ligera es un plan de empresa de pago de un proveedor grande de IA, usado bajo un contrato firmado y no con una cuenta de consumidor. · Camino dos El camino intermedio ejecuta un modelo de
Los tres caminos para usar IA con datos que no puedes pegar en herramientas públicas. · Camino uno La opción más ligera es un plan de empresa de pago de un proveedor grande de IA, usado bajo un contrato firmado y no con una cuenta de consumidor. · Camino dos El camino intermedio ejecuta un modelo de

Cuánto cuesta todo esto en realidad, y por qué las cifras redondas merecen sospecha

Para dar forma concreta a los caminos, los participantes lanzaron cifras : de veinte a sesenta dólares por usuario al mes para un plan de empresa, de mil quinientos a cuatro mil dólares al mes para un modelo corriendo en nube privada, y de quince mil a sesenta mil dólares o más para un servidor capaz. El investigador las trató como presupuestos ilustrativos, no como precios. El coste real varía con el hardware, la región, el tamaño del modelo, cuántas personas lo usan a la vez y con qué rapidez debe responder.

El renglón que más a menudo se deja fuera, coincidieron todos los participantes, es el de las personas. El trabajo de ingeniería e integración, y sobre todo construir una búsqueda de archivos que respete quién tiene permiso para ver qué, suele ser la factura oculta más grande. El modelo en sí rara vez es la parte cara.

Qué tan listos están los modelos abiertos para el trabajo corriente

Para las tareas sencillas que la mayoría de la gente quiere, resumir un informe largo, redactar un mensaje, extraer los términos clave de un documento o hacer preguntas sobre una carpeta de archivos, los modelos abiertos han avanzado mucho. El encargado de las pruebas de rendimiento situó a un modelo abierto de tamaño medio entre el noventa y el noventa y cinco por ciento de la calidad de uno de primera línea, pero el investigador señaló esa cifra como un juicio sin respaldo y dependiente de la tarea, no como una medición.

En lo que el panel coincidió con más firmeza es en esto : un modelo de la clase de setenta mil millones de parámetros maneja los resúmenes rutinarios y las respuestas a preguntas basadas en documentos lo bastante bien como para que los usuarios corrientes rara vez noten una diferencia, mientras que los modelos pequeños que caben en un portátil pierden detalle e inventan más, lo que los hace una mala herramienta principal para el trabajo delicado. Los modelos comerciales líderes siguen sacando ventaja en documentos escaneados y desordenados, en entradas muy largas leídas de una sola vez y en el razonamiento difícil de varios pasos.

Con los archivos, la búsqueda importa más que el modelo

Un tema recorrió todas las intervenciones : dejar que los empleados conversen con los archivos internos no es, en su mayor parte, una cuestión de la inteligencia del modelo. Depende de la capa de recuperación, el sistema que encuentra los fragmentos correctos y se los entrega al modelo junto con la pregunta. Si extrae el fragmento equivocado, hasta el mejor modelo responde mal.

Más grave aún, esa capa tiene que hacer respetar los mismos permisos de archivo que la gente ya tiene. De lo contrario, como dijo el juez, construyes una sofisticada herramienta interna de fuga de datos que permite a un empleado sin rango resumir archivos confidenciales de la dirección. Fundamentar las respuestas en fuentes citadas y mantener los documentos al día se nombraron como las partes que de verdad deciden si el sistema vale la pena.

Un orden sensato para probar las cosas

Para una empresa sin ingenieros de IA, el panel convergió en una secuencia antes que en una única respuesta. Clasifica primero tus datos, ya que no todo lo que se llama delicado carga con la misma restricción. Si la preocupación real es el entrenamiento y las herramientas públicas, lleva a tu equipo legal un plan de empresa bien contratado, porque ofrece la mayor calidad con el menor esfuerzo. Si los servicios de IA externos están prohibidos pero tu nube es de confianza, ejecuta un modelo abierto en tu propia cuenta. Reserva el hardware físico para los casos difíciles en los que una ley o un contrato no dejan otra salida.

Una advertencia surgió más de una vez : que los pesos sean abiertos no quiere decir que estén libres de ataduras legales, así que haz que alguien lea la licencia del modelo antes de construir sobre él. Y elijas lo que elijas, los participantes fueron unánimes en el último paso. Pruébalo con tus propios documentos y preguntas reales, porque ninguna tabla de clasificación pública puede decirte cómo se comporta con tus contratos, tus arrendamientos o tus tickets de soporte.

Cómo usar la IA con datos que no puedes pegar en ChatGPTCómo usar la IA con datos que no puedes pegar en ChatGPTTu empresa prohibió pegar datos confidenciales en herramientas de IA públicas. Hay tres caminos reales para seguir usando IA, y acertar empieza por una pregunta sobre tus propias normas, no sobre la tecnología.Primero, decide qué prohíbe en realidad tu normaCamino uno : un plan de empresa que promete no entrenar con tus datosCamino dos : tu propia nube, y por qué sigue siendo la nube de otroCamino tres : tu propio hardware, el máximo control y el máximo trabajo · Los tres caminos para usar IA con datos que no puedes pegar en herramientas públicas.Cuánto cuesta todo esto en realidad, y por qué las cifras redondas merecen sospechaNo hay una sola respuesta, sino un orden : clasifica tus datos, empieza por lo más ligero y prueba cada opción con tus propios documentos y preguntas reales.Fuentes openai.com · OpenAI : how we use your business data, openai.com · OpenAI : enterprise privacy, openai.com · OpenAI : zero data retention for frontier models

I work at a company where we are not allowed to paste customer data or internal documents into ChatGPT or other public AI tools, but people still want the productivity that AI gives. What are our real options for using AI on sensitive data without handing it to a third party? Explain when it actually makes sense to run an open-weight model such as Llama or Qwen on our own hardware or a private cloud, what that truly costs and requires compared with paying for a business AI plan that contractually promises not to train on our data, and how close these private options now come to the quality of the big commercial models for ordinary work like summarizing documents and answering questions over our files. Assume we are not AI engineers and lay out the tradeoffs plainly.

AI Model Performance & Quality Benchmarker · gemini-3-7-flash

When evaluating how to bring AI to sensitive internal documents without AI engineers on staff, the decision comes down to three realistic paths: Contractual Enterprise SaaS, Dedicated Private Cloud Hosting, and Self-Hosted / On-Premises Open Weights. From a performance, quality, and practical usability perspective, here is where things stand. --- 1. The Quality Gap: How Close Are Open Models Today? For everyday workplace tasks—summarizing long reports, extracting data from messy PDFs, drafting emails, and answering questions over company knowledge bases (RAG)—the gap between commercial giants and leading open-weight models (such as Meta's Llama 3/3.1 series or Alibaba's Qwen 2.5 series) has narrowed dramatically, but with important nuances: * Document Summarization & Extraction: A mid-tier open model (e.g., Llama 3.1 70B, Qwen 2.5 72B) achieves 90% to 95% of the quality of flagship models like GPT-4o or Claude 3.5 Sonnet. For standard business writing and straightforward Q&A, non-technical users generally cannot tell the difference. * Long-Context & Needle-in-a-Haystack Retrieval: Flagship commercial APIs excel at digesting 100k+ tokens (entire boo…

On-Premises & Private Cloud Infrastructure Specialist · gpt-5.6-terra

You have three genuinely different paths—not just “public ChatGPT versus build everything yourself.” 1. Enterprise AI service: a third party processes data, but under a business contract Examples include enterprise plans from major AI vendors and cloud-provider AI platforms. Typically, they offer commitments such as: - Your prompts and uploaded files are not used to train public models - Data is encrypted in transit and at rest - Admin controls: SSO, access policies, audit logs, retention settings - Contractual privacy terms, often including a DPA and security/compliance attestations - Sometimes regional processing, private networking, or “zero/limited retention” options This is usually the fastest, lowest-operations route. Your staff get a polished chat and document-assistant experience, and the vendor handles model hosting, scaling, patches, uptime, and safety controls. But it is still third-party processing. “Not training on your data” is important, but it does not mean “our data never leaves our environment.” Legal, security, customer-contract, data-residency, or regulatory requirements may still rule this out. You must also check the exact terms for retention,…

Enterprise SaaS Compliance & Security Advisor · deepseek-v4-pro

From a compliance and security lens, your company is actually facing two separate risks, and they lead to different answers: 1. Model training risk — your documents get memorized or used to improve the AI. 2. Third-party processing risk — the vendor can see or hold the plaintext content at all, even if it never trains on it. Many company policies conflate these. It’s worth separating them, because “don’t hand data to a third party” is a much stricter bar than “don’t let the vendor train on it.” --- Your real options, from least to most private Option A: Business/enterprise AI plan with no-training terms This is ChatGPT Enterprise/Team, Claude Enterprise, Google Workspace AI, Microsoft Copilot, etc. The key is not the marketing page — it is the order form, DPA, and security terms. What you need in the contract: - No training on your content. - No use of your data to improve models. - Zero retention or short retention with a delete option. - Data residency in your required regions. - A listed set of subprocessors. - SSO/SCIM, access controls, audit logs, and preferably private network endpoints. - Legal remedies if they breach. When it’s enough: for…

Researcher · gpt-5.6-terra

Fact-check: key corrections and caveats 1. “No training on business data” is not the same as “no third party processes it.” — Accurate. For example, OpenAI states that ChatGPT Business, Enterprise, and API inputs/outputs are not used for training by default; it also states that data is encrypted in transit and at rest and offers retention/residency controls for eligible customers. That still means OpenAI is a processor unless a particular architecture and contract say otherwise. Source: https://openai.com/business-data/ Source: https://openai.com/enterprise-privacy/ 2. “Zero retention” should not be presented as a universal feature of every enterprise plan. — Needs qualification. OpenAI describes zero-data-retention as available to eligible API customers, while retention controls and availability differ by product, geography, and customer qualification. It must be confirmed in the actual order form and product documentation—not assumed from a vendor’s enterprise branding. Source: https://openai.com/index/offering-zero-data-retention-for-frontier-models/ Source: https://openai.com/business-data/ 3. “A model deployed in our cloud tenant means data…

The Arbiter · gemini-3-7-flash

All three participants and the Researcher have laid out a consistent and realistic framework. Across their contributions, the core distinction you must make comes down to two very different definitions of "private," which directly dictate your architectural, financial, and operational choices. Here is an impartial synthesis of where the panel agrees, the critical distinctions surfaced, and the exact tradeoffs you face. --- 1. Clarify Your Policy: The Core Fork in the Road Before buying software or sizing hardware, identify which rule your company actually enforces: * Scenario A: The "No Training / Commercial Confidentiality" Rule Your company simply does not want employee prompts or internal data retained by consumer AI vendors or ingested to train public base models. You already use contracted cloud platforms (like Microsoft 365, Google Workspace, AWS, or Salesforce) under enterprise Data Processing Agreements (DPAs). * Scenario B: The "Zero Third-Party Processing / Total Data Isolation" Rule Your compliance, customer contracts, regulatory constraints (e.g., defense, healthcare enclaves, strict national sovereignty), or internal IP policies str…

The Arbiter's Final Verdict · gemini-3-7-flash

The Verdict If your team does not have dedicated AI engineers, jumping straight to self-hosting open-weight models is usually the wrong first step. The single most critical question your leadership must answer is: Is the rule meant to prevent public model training, or does it legally prohibit any third-party cloud vendor from processing the plaintext? --- 1. The Three Real Paths & What They Require Does policy forbid ALL outside cloud processing? / \ YES NO / \ Do you have physical servers & IT staff? Is extreme tenant isolation / \ required beyond standard SaaS? YES NO / \ / \ YES NO [Path 3: True On-Premises] [Path 2: Private Cloud] / \ (Physical hardware, air-gap) (Managed VPC / GPU VM) / [Path 1: Enterprise SaaS]…