Comment se servir de l'IA sur des données qu'on ne peut pas coller dans ChatGPT

Trois façons concrètes de se faire aider par l'IA sur des fichiers confidentiels, et la seule question sur vos propres règles qui décide laquelle vous convient.

IA et société · 2026-09-06

Votre entreprise a tracé une limite que beaucoup d'autres ont tracée cette année : ne pas coller de dossiers clients ni de documents internes dans ChatGPT ou dans un autre outil d'IA grand public. La crainte est légitime, et la demande de productivité qui monte de partout l'est tout autant. Ce qu'il faut retenir d'un récent échange organisé par Polora, où cinq modèles d'IA ont chacun tenu un rôle différent pour traiter précisément cette question, c'est que le choix ne se résume pas à utiliser ChatGPT public ou à tout construire soi-même. Il existe trois voies réellement distinctes, et bien choisir commence par une question sur vos propres règles plutôt que sur la technologie.

D'abord, déterminer ce que votre règle interdit vraiment

Le point le plus clairement partagé au cours de l'échange est que les entreprises confondent souvent deux règles très différentes. L'une dit qu'un prestataire ne peut pas conserver vos requêtes ni s'en servir pour améliorer ses modèles publics. Une autre, plus stricte, dit qu'aucune société extérieure ne peut voir ni détenir vos données en clair, quelles que soient les garanties d'un contrat. Le conseiller en conformité du panel a appelé cela le risque d'entraînement et le risque de traitement par un tiers, en soulignant que ne pas confier ses données à un tiers est une exigence bien plus élevée que ne pas s'en servir pour l'entraînement. Ce que votre politique vise réellement décide de tout le reste. La première démarche n'est donc pas de partir à la recherche d'un logiciel. C'est de demander à vos équipes juridiques et de sécurité quelle ligne elles ont réellement tracée.

Voie une : un forfait professionnel qui s'engage à ne pas s'entraîner sur vos données

L'option la plus légère est un forfait entreprise payant chez un grand fournisseur d'IA, utilisé dans le cadre d'un contrat signé et non de l'inscription grand public. Le conseiller a insisté sur un point : l'engagement se trouve dans le bon de commande et dans l'accord de traitement des données, pas sur la page marketing. On y lit l'absence d'entraînement sur vos contenus, le chiffrement, une durée de conservation définie, la localisation des données, une liste nommée de sous-traitants ainsi qu'une connexion d'entreprise avec journaux d'audit. Le spécialiste des infrastructures a décrit cette voie comme la plus rapide et la moins exigeante en efforts, puisque le fournisseur fait tourner le modèle et que vos équipes n'ont qu'à se connecter.

Le chercheur qui a vérifié ces affirmations a ajouté une réserve utile à garder en tête. OpenAI, par exemple, indique que les entrées de ses offres professionnelles et entreprise ne servent pas par défaut à entraîner ses modèles, mais la conservation nulle n'est proposée qu'aux clients éligibles et varie selon le produit et la région. Cela doit être confirmé dans votre propre contrat, et non supposé à partir de l'étiquette entreprise d'un fournisseur.

Voie deux : votre propre cloud, et pourquoi il reste le cloud de quelqu'un d'autre

La voie intermédiaire consiste à faire tourner un modèle à poids ouverts, comme Llama de Meta ou Qwen d'Alibaba, à l'intérieur du compte de votre entreprise sur AWS, Azure ou Google. Vos fichiers restent dans le périmètre de votre réseau, et la société qui a construit le modèle ne les voit jamais. Plusieurs participants ont présenté cela comme la réponse lorsque la règle interdit les services d'IA extérieurs mais que votre fournisseur de cloud actuel est déjà de confiance.

Le chercheur a nuancé une exagération fréquente. Un modèle qui tourne dans votre espace cloud ne supprime pas le traitement par un tiers. Selon la plupart des définitions de la vie privée, le fournisseur de cloud reste un sous-traitant, et les propres recommandations d'AWS présentent ses contrôles de réseau privé comme un moyen de réduire l'exposition, non de mettre fin à cette relation. Si votre règle interdit vraiment tout sous-traitant extérieur, cette voie n'y satisfait pas.

※ modèle à poids ouverts : un modèle d'IA dont les réglages internes sont publiés, de sorte que chacun peut le télécharger et le faire tourner sur ses propres machines au lieu de passer uniquement par le site de son concepteur.

Voie trois : votre propre matériel, le plus de contrôle et le plus de travail

La voie la plus stricte consiste à acheter des serveurs physiques et à faire tourner le modèle entièrement à l'intérieur de vos locaux, sans aucune connexion extérieure. C'est le seul dispositif qui puisse honnêtement signifier qu'aucune société extérieure ne touche les données, et le panel s'est accordé sur le fait qu'il convient au travail de défense, à un environnement isolé du réseau ou aux contrats qui interdisent tout traitement externe.

Les participants ont dit sans détour qu'il ne s'agit pas d'un achat mais d'un service qu'il faut faire tourner : matériel, alimentation, refroidissement, correctifs de sécurité, sauvegardes et personnes pour maintenir le tout en vie. Le juge a averti qu'une entreprise sans ingénieurs en IA peut transformer cela en fardeau informatique laissé à l'abandon, et qu'un modèle téléchargé n'est que le moteur, jamais le produit fini.

※ isolé du réseau : maintenu physiquement déconnecté d'internet et des réseaux extérieurs, de sorte qu'aucune donnée ne dispose d'un chemin pour sortir de la machine.

Ce que tout cela coûte vraiment, et pourquoi les chiffres ronds méritent la méfiance

Pour rendre les voies concrètes, les participants ont avancé des ordres de grandeur : environ vingt à soixante dollars par utilisateur et par mois pour un forfait professionnel, mille cinq cents à quatre mille dollars par mois pour un modèle tournant dans un cloud privé, et quinze à soixante mille dollars ou davantage pour un serveur performant. Le chercheur a traité ces chiffres comme des budgets illustratifs, non comme des prix. Le coût réel varie avec le matériel, la région, la taille du modèle, le nombre de personnes qui s'en servent en même temps et la rapidité de réponse exigée.

L'élément le plus souvent oublié, tous les participants en ont convenu, ce sont les personnes. Le travail d'ingénierie et d'intégration, et surtout la construction d'une recherche de fichiers qui respecte qui a le droit de voir quoi, tend à représenter la plus grosse facture cachée. Le modèle lui-même est rarement la partie coûteuse.

À quel point les modèles ouverts sont-ils proches pour le travail ordinaire

Pour les tâches simples que la plupart des gens attendent, résumer un long rapport, rédiger un message, extraire les termes clés d'un document ou poser des questions sur un dossier de fichiers, les modèles ouverts ont beaucoup progressé. Le spécialiste des tests de performance de l'échange a situé un modèle ouvert de taille moyenne à quatre-vingt-dix ou quatre-vingt-quinze pour cent de la qualité d'un modèle de pointe, mais le chercheur a signalé que ce chiffre était un jugement non étayé et dépendant de la tâche plutôt qu'une mesure.

Ce sur quoi le panel s'est accordé avec plus de fermeté, c'est ceci : un modèle de la catégorie soixante-dix milliards de paramètres gère assez bien les résumés courants et les réponses à des questions ancrées dans les documents pour que les utilisateurs ordinaires perçoivent rarement un écart, tandis que les petits modèles qui tiennent sur un ordinateur portable perdent des détails et inventent davantage, ce qui en fait un mauvais outil principal pour du travail sensible. Les modèles commerciaux de tête gardent l'avantage sur les documents scannés en désordre, les entrées très longues lues en une seule passe et les raisonnements difficiles à plusieurs étapes.

Pour les fichiers, la recherche compte plus que le modèle

Un même fil a traversé toutes les interventions : permettre aux employés de dialoguer avec les fichiers internes ne tient pour l'essentiel pas à l'intelligence du modèle. Cela repose sur la couche de récupération, le système qui trouve les bons passages et les remet au modèle avec la question. S'il récupère le mauvais passage, même le meilleur modèle répondra mal.

Plus grave, cette couche doit appliquer les mêmes droits d'accès aux fichiers que ceux dont les gens disposent déjà. Sinon, comme l'a formulé le juge, on construit un outil sophistiqué de fuite de données internes qui laisse un employé débutant résumer des fichiers confidentiels de la direction. Ancrer les réponses dans des sources citées et maintenir les documents à jour ont été désignés comme les éléments qui décident réellement si le système vaut la peine d'exister.

Un ordre raisonnable pour faire ses essais

Pour une entreprise sans ingénieurs en IA, le panel a convergé vers une séquence plutôt que vers une réponse unique. Classez d'abord vos données, car tout ce qu'on appelle sensible ne porte pas la même restriction. Si la vraie inquiétude concerne l'entraînement et les outils publics, présentez à votre équipe juridique un forfait professionnel dûment contractualisé, car il offre la plus haute qualité pour le moindre effort. Si les services d'IA extérieurs sont interdits mais que votre cloud est de confiance, faites tourner un modèle ouvert dans votre propre espace. Réservez le matériel physique aux cas difficiles où une loi ou un contrat ne laisse aucune autre issue.

Une mise en garde est revenue plus d'une fois : poids ouverts ne veut pas dire libre de toute contrainte juridique, alors faites lire la licence du modèle par quelqu'un avant de construire dessus. Et quel que soit votre choix, les participants étaient unanimes sur la dernière étape. Testez-le sur vos propres documents et vos propres questions, car aucun classement public ne peut vous dire comment il traite vos contrats, vos baux ou vos tickets d'assistance.

Trois voies distinctes qui se rejoignent sur une même dernière étape. · un forfait professionnel Le spécialiste des infrastructures a décrit cette voie comme la plus rapide et la moins exigeante en efforts, puisque le fournisseur fait tourner le modèle et que vos équipes n'ont qu'à se connecter. · v
Trois voies distinctes qui se rejoignent sur une même dernière étape. · un forfait professionnel Le spécialiste des infrastructures a décrit cette voie comme la plus rapide et la moins exigeante en efforts, puisque le fournisseur fait tourner le modèle et que vos équipes n'ont qu'à se connecter. · v
Comment se servir de l'IA sur des données qu'on ne peut pas coller dans ChatGPTComment se servir de l'IA sur des données qu'on ne peut pas coller dans ChatGPTVotre entreprise interdit de coller des fichiers confidentiels dans ChatGPT. Il existe trois voies distinctes, et bien choisir commence par une question sur vos propres règles.D'abord, déterminer ce que votre règle interdit vraimentVoie une : un forfait professionnel qui s'engage à ne pas s'entraîner sur vos donnéesVoie deux : votre propre cloud, et pourquoi il reste le cloud de quelqu'un d'autreVoie trois : votre propre matériel, le plus de contrôle et le plus de travailCe que tout cela coûte vraiment, et pourquoi les chiffres ronds méritent la méfianceQuel que soit votre choix, testez-le sur vos propres documents et vos propres questions : aucun classement public ne dit comment il traite vos contrats. · Trois voies distinctes qui se rejoignent sur une même dernière étape.Sources openai.com · OpenAI : how we use your business data, openai.com · OpenAI : enterprise privacy, openai.com · OpenAI : zero data retention for frontier models

I work at a company where we are not allowed to paste customer data or internal documents into ChatGPT or other public AI tools, but people still want the productivity that AI gives. What are our real options for using AI on sensitive data without handing it to a third party? Explain when it actually makes sense to run an open-weight model such as Llama or Qwen on our own hardware or a private cloud, what that truly costs and requires compared with paying for a business AI plan that contractually promises not to train on our data, and how close these private options now come to the quality of the big commercial models for ordinary work like summarizing documents and answering questions over our files. Assume we are not AI engineers and lay out the tradeoffs plainly.

AI Model Performance & Quality Benchmarker · gemini-3-7-flash

When evaluating how to bring AI to sensitive internal documents without AI engineers on staff, the decision comes down to three realistic paths: Contractual Enterprise SaaS, Dedicated Private Cloud Hosting, and Self-Hosted / On-Premises Open Weights. From a performance, quality, and practical usability perspective, here is where things stand. --- 1. The Quality Gap: How Close Are Open Models Today? For everyday workplace tasks—summarizing long reports, extracting data from messy PDFs, drafting emails, and answering questions over company knowledge bases (RAG)—the gap between commercial giants and leading open-weight models (such as Meta's Llama 3/3.1 series or Alibaba's Qwen 2.5 series) has narrowed dramatically, but with important nuances: * Document Summarization & Extraction: A mid-tier open model (e.g., Llama 3.1 70B, Qwen 2.5 72B) achieves 90% to 95% of the quality of flagship models like GPT-4o or Claude 3.5 Sonnet. For standard business writing and straightforward Q&A, non-technical users generally cannot tell the difference. * Long-Context & Needle-in-a-Haystack Retrieval: Flagship commercial APIs excel at digesting 100k+ tokens (entire boo…

On-Premises & Private Cloud Infrastructure Specialist · gpt-5.6-terra

You have three genuinely different paths—not just “public ChatGPT versus build everything yourself.” 1. Enterprise AI service: a third party processes data, but under a business contract Examples include enterprise plans from major AI vendors and cloud-provider AI platforms. Typically, they offer commitments such as: - Your prompts and uploaded files are not used to train public models - Data is encrypted in transit and at rest - Admin controls: SSO, access policies, audit logs, retention settings - Contractual privacy terms, often including a DPA and security/compliance attestations - Sometimes regional processing, private networking, or “zero/limited retention” options This is usually the fastest, lowest-operations route. Your staff get a polished chat and document-assistant experience, and the vendor handles model hosting, scaling, patches, uptime, and safety controls. But it is still third-party processing. “Not training on your data” is important, but it does not mean “our data never leaves our environment.” Legal, security, customer-contract, data-residency, or regulatory requirements may still rule this out. You must also check the exact terms for retention,…

Enterprise SaaS Compliance & Security Advisor · deepseek-v4-pro

From a compliance and security lens, your company is actually facing two separate risks, and they lead to different answers: 1. Model training risk — your documents get memorized or used to improve the AI. 2. Third-party processing risk — the vendor can see or hold the plaintext content at all, even if it never trains on it. Many company policies conflate these. It’s worth separating them, because “don’t hand data to a third party” is a much stricter bar than “don’t let the vendor train on it.” --- Your real options, from least to most private Option A: Business/enterprise AI plan with no-training terms This is ChatGPT Enterprise/Team, Claude Enterprise, Google Workspace AI, Microsoft Copilot, etc. The key is not the marketing page — it is the order form, DPA, and security terms. What you need in the contract: - No training on your content. - No use of your data to improve models. - Zero retention or short retention with a delete option. - Data residency in your required regions. - A listed set of subprocessors. - SSO/SCIM, access controls, audit logs, and preferably private network endpoints. - Legal remedies if they breach. When it’s enough: for…

Researcher · gpt-5.6-terra

Fact-check: key corrections and caveats 1. “No training on business data” is not the same as “no third party processes it.” — Accurate. For example, OpenAI states that ChatGPT Business, Enterprise, and API inputs/outputs are not used for training by default; it also states that data is encrypted in transit and at rest and offers retention/residency controls for eligible customers. That still means OpenAI is a processor unless a particular architecture and contract say otherwise. Source: https://openai.com/business-data/ Source: https://openai.com/enterprise-privacy/ 2. “Zero retention” should not be presented as a universal feature of every enterprise plan. — Needs qualification. OpenAI describes zero-data-retention as available to eligible API customers, while retention controls and availability differ by product, geography, and customer qualification. It must be confirmed in the actual order form and product documentation—not assumed from a vendor’s enterprise branding. Source: https://openai.com/index/offering-zero-data-retention-for-frontier-models/ Source: https://openai.com/business-data/ 3. “A model deployed in our cloud tenant means data…

The Arbiter · gemini-3-7-flash

All three participants and the Researcher have laid out a consistent and realistic framework. Across their contributions, the core distinction you must make comes down to two very different definitions of "private," which directly dictate your architectural, financial, and operational choices. Here is an impartial synthesis of where the panel agrees, the critical distinctions surfaced, and the exact tradeoffs you face. --- 1. Clarify Your Policy: The Core Fork in the Road Before buying software or sizing hardware, identify which rule your company actually enforces: * Scenario A: The "No Training / Commercial Confidentiality" Rule Your company simply does not want employee prompts or internal data retained by consumer AI vendors or ingested to train public base models. You already use contracted cloud platforms (like Microsoft 365, Google Workspace, AWS, or Salesforce) under enterprise Data Processing Agreements (DPAs). * Scenario B: The "Zero Third-Party Processing / Total Data Isolation" Rule Your compliance, customer contracts, regulatory constraints (e.g., defense, healthcare enclaves, strict national sovereignty), or internal IP policies str…

The Arbiter's Final Verdict · gemini-3-7-flash

The Verdict If your team does not have dedicated AI engineers, jumping straight to self-hosting open-weight models is usually the wrong first step. The single most critical question your leadership must answer is: Is the rule meant to prevent public model training, or does it legally prohibit any third-party cloud vendor from processing the plaintext? --- 1. The Three Real Paths & What They Require Does policy forbid ALL outside cloud processing? / \ YES NO / \ Do you have physical servers & IT staff? Is extreme tenant isolation / \ required beyond standard SaaS? YES NO / \ / \ YES NO [Path 3: True On-Premises] [Path 2: Private Cloud] / \ (Physical hardware, air-gap) (Managed VPC / GPU VM) / [Path 1: Enterprise SaaS]…