ChatGPT에 붙여 넣을 수 없는 데이터에 AI를 쓰는 법

기밀 파일을 다룰 때 AI의 도움을 받는 세 가지 실제 방법, 그리고 그중 무엇이 맞는지를 가르는 우리 회사 규칙에 관한 질문 하나.

AI와 사회 · 2026-09-06

올해 많은 회사가 그은 선을 우리 회사도 그었습니다 : 고객 기록이나 내부 문서를 ChatGPT를 비롯한 어떤 공개 AI 도구에도 붙여 넣지 말 것. 그 걱정도 당연하고, 사람들이 생산성을 계속 바라는 것도 당연합니다. 최근 폴로라 대화에서는 다섯 개의 AI 모델이 각자 다른 역할을 맡아 바로 이 질문을 파고들었습니다. 거기서 나온 쓸모 있는 소식은, 선택지가 공개 ChatGPT냐 전부 직접 만드느냐로 갈리지 않는다는 것입니다. 정말로 서로 다른 세 갈래 길이 있고, 잘 고르는 일은 기술이 아니라 우리 회사의 규칙에 관한 질문에서 시작합니다.

먼저 우리 규칙이 실제로 무엇을 금지하는지 정하기

대화 전체에서 가장 또렷하게 공유된 지점은, 회사들이 서로 아주 다른 두 규칙을 자주 뒤섞는다는 것이었습니다. 하나는 업체가 우리 프롬프트를 보관하거나 그것으로 자사의 공개 모델을 개선해서는 안 된다는 규칙입니다. 더 엄격한 다른 하나는, 계약이 무엇을 약속하든 외부 회사가 우리 평문을 보거나 갖고 있어서는 안 된다는 규칙입니다. 규정 자문을 맡은 참가자는 이 둘을 각각 학습 위험과 제3자 처리 위험이라고 부르며, 데이터를 제3자에게 넘기지 말라는 것은 그것으로 학습하지 말라는 것보다 훨씬 높은 기준이라고 짚었습니다. 우리 정책이 이 중 어느 쪽을 뜻하는지가 그다음 모든 것을 정합니다. 그래서 첫 수는 소프트웨어를 사러 다니는 것이 아닙니다. 법무팀과 보안팀에 실제로 어느 선을 그었는지 묻는 것입니다.

우리 정책이 어느 규칙을 뜻하는지가 그다음 선택을 모두 정합니다. · 학습 위험 하나는 업체가 우리 프롬프트를 보관하거나 그것으로 자사의 공개 모델을 개선해서는 안 된다는 규칙입니다. · 제3자 처리 위험 더 엄격한 다른 하나는, 계약이 무엇을 약속하든 외부 회사가 우리 평문을 보거나 갖고 있어서는 안 된다는 규칙입니다.
우리 정책이 어느 규칙을 뜻하는지가 그다음 선택을 모두 정합니다. · 학습 위험 하나는 업체가 우리 프롬프트를 보관하거나 그것으로 자사의 공개 모델을 개선해서는 안 된다는 규칙입니다. · 제3자 처리 위험 더 엄격한 다른 하나는, 계약이 무엇을 약속하든 외부 회사가 우리 평문을 보거나 갖고 있어서는 안 된다는 규칙입니다.

첫 번째 길 : 우리 데이터로 학습하지 않겠다고 약속하는 업무용 요금제

가장 가벼운 선택지는 대형 AI 업체의 유료 기업용 요금제를, 소비자용 가입이 아니라 정식으로 맺은 계약 아래 쓰는 것입니다. 규정 자문 참가자의 요점은, 그 약속이 홍보 페이지가 아니라 주문서와 데이터 처리 계약서에 들어 있다는 것이었습니다 : 우리 콘텐츠로 학습하지 않을 것, 암호화, 정해진 보관 기간, 데이터가 놓이는 지역, 이름이 명시된 하위 처리자 목록, 그리고 감사 기록이 남는 회사 계정 로그인. 인프라 전문가 참가자는 이것을 가장 빠르고 손이 가장 덜 가는 길이라고 설명했습니다. 모델은 업체가 돌리고, 우리 직원은 그저 로그인만 하면 되기 때문입니다.

이 주장들을 사실 확인한 연구원 참가자는 새겨 둘 만한 단서를 덧붙였습니다. 예를 들어 OpenAI는 기업용과 엔터프라이즈 입력을 기본적으로 자사 모델 학습에 쓰지 않는다고 밝히지만, 데이터를 아예 보관하지 않는 방식은 자격을 갖춘 고객에게만 제공되고 제품과 지역에 따라 달라집니다. 이는 기업용이라는 이름만 보고 넘겨짚을 것이 아니라 우리 계약서에서 직접 확인해야 합니다.

두 번째 길 : 우리 클라우드, 그런데 왜 그것이 여전히 남의 클라우드인가

가운데 길은 메타의 Llama나 알리바바의 Qwen 같은 공개 가중치 모델을, AWS나 Azure나 구글에 있는 우리 회사 계정 안에서 돌리는 것입니다. 파일은 우리 네트워크 울타리 안에 머물고, 그 모델을 만든 회사는 파일을 결코 보지 못합니다. 외부 AI 서비스는 금지하지만 이미 쓰고 있는 클라우드 사업자는 믿는 회사라면 이 길이 답이 된다고 여러 참가자가 말했습니다.

연구원 참가자는 흔한 과장 하나를 바로잡았습니다. 우리 클라우드 계정 안에서 도는 모델이라 해도 제3자 처리가 사라지지는 않습니다. 대부분의 개인정보 정의에서 클라우드 사업자는 여전히 처리자이고, AWS 자체 지침도 사설 네트워크 통제를 그 관계를 끝내는 것이 아니라 노출을 좁히는 것이라고 설명합니다. 우리 규칙이 어떤 외부 처리자도 정말로 금지한다면, 이 길은 그 규칙을 충족하지 못합니다.

※ 공개 가중치 모델 : 내부 설정값이 공개되어 있어서, 만든 회사의 웹사이트를 거치지 않고 누구나 내려받아 자기 기기에서 돌릴 수 있는 AI 모델.

세 번째 길 : 우리 하드웨어, 가장 큰 통제와 가장 많은 수고

가장 엄격한 길은 물리 서버를 사서, 외부 연결을 하나도 두지 않은 채 모델을 건물 안에서 통째로 돌리는 것입니다. 외부 회사가 데이터에 손대지 않는다고 정직하게 말할 수 있는 유일한 방식이고, 참가자들은 이것이 국방 업무나 인터넷과 끊어 놓은 격리 공간, 또는 어떤 외부 처리도 금지하는 계약에 맞는다는 데 뜻을 같이했습니다.

참가자들은 이것이 한 번 사고 마는 물건이 아니라 우리가 계속 돌려야 하는 일이라고 잘라 말했습니다 : 하드웨어, 전력, 냉각, 보안 패치, 백업, 그리고 그것을 살아 있게 지키는 사람들. 판결 역할은 AI 엔지니어가 없는 회사에서는 이것이 방치된 IT 골칫거리가 될 수 있고, 내려받은 모델은 엔진일 뿐 결코 완성된 제품이 아니라고 경고했습니다.

규칙이 무엇을 금지하느냐에 따라 세 길 중 하나가 답이 됩니다. · 유료 기업용 요금제 가장 가벼운 선택지는 대형 AI 업체의 유료 기업용 요금제를, 소비자용 가입이 아니라 정식으로 맺은 계약 아래 쓰는 것입니다. · 공개 가중치 모델 가운데 길은 메타의 Llama나 알리바바의 Qwen 같은 공개 가중치 모델을, AWS나 Azure나 구글에 있는 우리 회사 계정 안에서 돌리는 것입니다. · 물리 서버 가장 엄격한 길은 물리 서버를 사서, 외부 연결을 하나도 두지 않은 채 모델을 건물 안에서 통째로 돌리는 것입니다.
규칙이 무엇을 금지하느냐에 따라 세 길 중 하나가 답이 됩니다. · 유료 기업용 요금제 가장 가벼운 선택지는 대형 AI 업체의 유료 기업용 요금제를, 소비자용 가입이 아니라 정식으로 맺은 계약 아래 쓰는 것입니다. · 공개 가중치 모델 가운데 길은 메타의 Llama나 알리바바의 Qwen 같은 공개 가중치 모델을, AWS나 Azure나 구글에 있는 우리 회사 계정 안에서 돌리는 것입니다. · 물리 서버 가장 엄격한 길은 물리 서버를 사서, 외부 연결을 하나도 두지 않은 채 모델을 건물 안에서 통째로 돌리는 것입니다.

이 모든 것이 실제로 드는 비용, 그리고 딱 떨어지는 숫자를 의심해야 하는 이유

길들을 손에 잡히게 하려고 참가자들은 대략의 수치를 던졌습니다 : 업무용 요금제는 사용자 한 명당 매달 이십에서 육십 달러, 사설 클라우드에서 돌리는 모델은 한 달에 천오백에서 사천 달러, 그리고 성능이 받쳐 주는 서버는 만 오천에서 육만 달러 혹은 그 이상. 연구원 참가자는 이 숫자들을 값이 아니라 어림잡은 예산으로 다루었습니다. 실제 비용은 하드웨어, 지역, 모델의 크기, 한꺼번에 쓰는 사람 수, 그리고 얼마나 빨리 답해야 하는지에 따라 출렁입니다.

참가자 모두가 동의한, 가장 자주 빠지는 항목은 사람입니다. 엔지니어링과 통합 작업, 그리고 무엇보다 누가 무엇을 볼 수 있는지를 지키는 파일 검색을 만드는 일이 대개 가장 큰 숨은 비용입니다. 모델 자체가 비싼 부분인 경우는 드뭅니다.

일상 업무에서 공개 모델은 얼마나 가까이 왔나

대부분의 사람이 바라는 평범한 일들, 곧 긴 보고서를 요약하고, 메시지 초안을 잡고, 문서에서 핵심 용어를 뽑고, 파일이 든 폴더 전체에 걸쳐 질문하는 일이라면 공개 모델은 크게 발전했습니다. 대화에서 벤치마크를 맡은 참가자는 중간 크기의 공개 모델을 선두 모델 품질의 구십에서 구십오 퍼센트에 놓았지만, 연구원 참가자는 그 수치를 측정값이 아니라 뒷받침되지 않은, 과제에 따라 달라지는 판단이라고 지적했습니다.

참가자들이 더 단단하게 동의한 것은 이것입니다 : 칠백억 매개변수급 모델은 일상적인 요약과 근거에 기댄 질의응답을, 보통 사용자가 좀처럼 차이를 느끼지 못할 만큼 잘 처리합니다. 반면 노트북에 들어갈 만큼 작은 모델은 세부를 놓치고 더 많이 지어내서 민감한 업무의 주력 도구로는 부적합합니다. 상용 선두 모델은 지저분하게 스캔된 문서, 한 번에 통째로 읽어야 하는 아주 긴 입력, 그리고 여러 단계를 밟아야 하는 어려운 추론에서는 여전히 앞서 나갑니다.

파일 앞에서는 모델보다 검색이 더 중요하다

모든 발언을 관통한 주제 하나는, 직원이 내부 파일과 대화하게 하는 일이 대부분 모델의 똑똑함에 달린 문제가 아니라는 것입니다. 그것은 검색 계층, 곧 알맞은 대목을 찾아 질문과 함께 모델에 건네주는 장치에 달려 있습니다. 이 장치가 엉뚱한 발췌를 끌어오면 아무리 좋은 모델도 엉뚱하게 답합니다.

더 심각하게는, 그 계층이 사람들이 이미 가진 파일 권한을 그대로 지켜야 합니다. 그러지 않으면, 판결 역할의 말대로, 신입 직원이 기밀 임원 파일을 요약할 수 있게 해 주는 정교한 내부 정보 유출 도구를 만드는 셈입니다. 답을 출처가 밝혀진 근거에 묶어 두는 것과 문서를 최신으로 유지하는 것이, 이 시스템이 값어치가 있는지를 실제로 가르는 부분으로 꼽혔습니다.

차근차근 시도해 볼 만한 순서

AI 엔지니어가 없는 회사라면, 참가자들은 하나의 정답이 아니라 하나의 순서로 모였습니다. 먼저 데이터를 분류하라는 것입니다. 민감하다고 불리는 것이 모두 같은 제약을 받는 것은 아니기 때문입니다. 진짜 걱정이 학습과 공개 도구라면, 정식으로 계약한 업무용 요금제를 법무팀에 가져가 보라고 했습니다. 가장 적은 수고로 가장 높은 품질을 주기 때문입니다. 외부 AI 서비스는 금지되지만 우리 클라우드는 믿을 수 있다면, 공개 모델을 우리 계정 안에서 돌리는 방안을 들었습니다. 물리 하드웨어는 법이나 계약이 다른 길을 남기지 않는 어려운 경우를 위해 남겨 두라는 것이었습니다.

한 가지 당부가 여러 번 나왔습니다 : 공개 가중치라고 해서 법적 조건에서 자유롭다는 뜻은 아니므로, 무언가를 그 위에 짓기 전에 누군가 모델의 라이선스를 읽어 두라는 것입니다. 그리고 무엇을 고르든 참가자들은 마지막 단계에서 한목소리였습니다. 우리 자신의 진짜 문서와 질문으로 시험해 보라는 것입니다. 어떤 공개 순위표도 그것이 우리 계약서와 임대차 문서와 고객 지원 문의를 어떻게 다루는지는 말해 주지 못하기 때문입니다.

ChatGPT에 붙여 넣을 수 없는 데이터에 AI를 쓰는 법ChatGPT에 붙여 넣을 수 없는 데이터에 AI를 쓰는 법올해 많은 회사가 고객 기록과 내부 문서를 ChatGPT를 비롯한 공개 AI 도구에 붙여 넣지 못하게 막았습니다. 그래도 사람들은 생산성을 원합니다. 다섯 개의 AI 모델이 이 질문을 파고든 결과, 길은 공개 도구냐 전부 직접 만드느냐로 갈리지 않았습니다. 서로 다른 세 갈래가 있고, 잘 고르는 일은 우리 회사 규칙에 관한 질문에서 시작합니다.먼저 우리 규칙이 실제로 무엇을 금지하는지 정하기 · 우리 정책이 어느 규칙을 뜻하는지가 그다음 선택을 모두 정합니다. · ※ 평문 : 암호로 바꾸지 않아 그대로 읽을 수 있는 원래 데이터첫 번째 길 : 우리 데이터로 학습하지 않겠다고 약속하는 업무용 요금제 · ※ 하위 처리자 : 그 업체가 데이터 처리를 다시 맡기는 또 다른 외부 회사두 번째 길 : 우리 클라우드, 그런데 왜 그것이 여전히 남의 클라우드인가 · ※ 공개 가중치 모델 : 내부 설정값이 공개되어 누구나 내려받아 자기 기기에서 돌릴 수 있는 AI 모델세 번째 길 : 우리 하드웨어, 가장 큰 통제와 가장 많은 수고 · 규칙이 무엇을 금지하느냐에 따라 세 길 중 하나가 답이 됩니다.이 모든 것이 실제로 드는 비용, 그리고 딱 떨어지는 숫자를 의심해야 하는 이유참가자들은 하나의 정답이 아니라 하나의 순서로 모였습니다. 먼저 데이터를 분류하고, 걱정이 학습과 공개 도구라면 계약한 업무용 요금제부터, 물리 하드웨어는 어려운 경우에 남겨 두라는 것입니다. 그리고 무엇을 고르든 우리 자신의 진짜 문서와 질문으로 시험해 보라고 했습니다.출처 openai.com · OpenAI : how we use your business data, openai.com · OpenAI : enterprise privacy, openai.com · OpenAI : zero data retention for frontier models

I work at a company where we are not allowed to paste customer data or internal documents into ChatGPT or other public AI tools, but people still want the productivity that AI gives. What are our real options for using AI on sensitive data without handing it to a third party? Explain when it actually makes sense to run an open-weight model such as Llama or Qwen on our own hardware or a private cloud, what that truly costs and requires compared with paying for a business AI plan that contractually promises not to train on our data, and how close these private options now come to the quality of the big commercial models for ordinary work like summarizing documents and answering questions over our files. Assume we are not AI engineers and lay out the tradeoffs plainly.

AI Model Performance & Quality Benchmarker · gemini-3-7-flash

When evaluating how to bring AI to sensitive internal documents without AI engineers on staff, the decision comes down to three realistic paths: Contractual Enterprise SaaS, Dedicated Private Cloud Hosting, and Self-Hosted / On-Premises Open Weights. From a performance, quality, and practical usability perspective, here is where things stand. --- 1. The Quality Gap: How Close Are Open Models Today? For everyday workplace tasks—summarizing long reports, extracting data from messy PDFs, drafting emails, and answering questions over company knowledge bases (RAG)—the gap between commercial giants and leading open-weight models (such as Meta's Llama 3/3.1 series or Alibaba's Qwen 2.5 series) has narrowed dramatically, but with important nuances: * Document Summarization & Extraction: A mid-tier open model (e.g., Llama 3.1 70B, Qwen 2.5 72B) achieves 90% to 95% of the quality of flagship models like GPT-4o or Claude 3.5 Sonnet. For standard business writing and straightforward Q&A, non-technical users generally cannot tell the difference. * Long-Context & Needle-in-a-Haystack Retrieval: Flagship commercial APIs excel at digesting 100k+ tokens (entire boo…

On-Premises & Private Cloud Infrastructure Specialist · gpt-5.6-terra

You have three genuinely different paths—not just “public ChatGPT versus build everything yourself.” 1. Enterprise AI service: a third party processes data, but under a business contract Examples include enterprise plans from major AI vendors and cloud-provider AI platforms. Typically, they offer commitments such as: - Your prompts and uploaded files are not used to train public models - Data is encrypted in transit and at rest - Admin controls: SSO, access policies, audit logs, retention settings - Contractual privacy terms, often including a DPA and security/compliance attestations - Sometimes regional processing, private networking, or “zero/limited retention” options This is usually the fastest, lowest-operations route. Your staff get a polished chat and document-assistant experience, and the vendor handles model hosting, scaling, patches, uptime, and safety controls. But it is still third-party processing. “Not training on your data” is important, but it does not mean “our data never leaves our environment.” Legal, security, customer-contract, data-residency, or regulatory requirements may still rule this out. You must also check the exact terms for retention,…

Enterprise SaaS Compliance & Security Advisor · deepseek-v4-pro

From a compliance and security lens, your company is actually facing two separate risks, and they lead to different answers: 1. Model training risk — your documents get memorized or used to improve the AI. 2. Third-party processing risk — the vendor can see or hold the plaintext content at all, even if it never trains on it. Many company policies conflate these. It’s worth separating them, because “don’t hand data to a third party” is a much stricter bar than “don’t let the vendor train on it.” --- Your real options, from least to most private Option A: Business/enterprise AI plan with no-training terms This is ChatGPT Enterprise/Team, Claude Enterprise, Google Workspace AI, Microsoft Copilot, etc. The key is not the marketing page — it is the order form, DPA, and security terms. What you need in the contract: - No training on your content. - No use of your data to improve models. - Zero retention or short retention with a delete option. - Data residency in your required regions. - A listed set of subprocessors. - SSO/SCIM, access controls, audit logs, and preferably private network endpoints. - Legal remedies if they breach. When it’s enough: for…

Researcher · gpt-5.6-terra

Fact-check: key corrections and caveats 1. “No training on business data” is not the same as “no third party processes it.” — Accurate. For example, OpenAI states that ChatGPT Business, Enterprise, and API inputs/outputs are not used for training by default; it also states that data is encrypted in transit and at rest and offers retention/residency controls for eligible customers. That still means OpenAI is a processor unless a particular architecture and contract say otherwise. Source: https://openai.com/business-data/ Source: https://openai.com/enterprise-privacy/ 2. “Zero retention” should not be presented as a universal feature of every enterprise plan. — Needs qualification. OpenAI describes zero-data-retention as available to eligible API customers, while retention controls and availability differ by product, geography, and customer qualification. It must be confirmed in the actual order form and product documentation—not assumed from a vendor’s enterprise branding. Source: https://openai.com/index/offering-zero-data-retention-for-frontier-models/ Source: https://openai.com/business-data/ 3. “A model deployed in our cloud tenant means data…

The Arbiter · gemini-3-7-flash

All three participants and the Researcher have laid out a consistent and realistic framework. Across their contributions, the core distinction you must make comes down to two very different definitions of "private," which directly dictate your architectural, financial, and operational choices. Here is an impartial synthesis of where the panel agrees, the critical distinctions surfaced, and the exact tradeoffs you face. --- 1. Clarify Your Policy: The Core Fork in the Road Before buying software or sizing hardware, identify which rule your company actually enforces: * Scenario A: The "No Training / Commercial Confidentiality" Rule Your company simply does not want employee prompts or internal data retained by consumer AI vendors or ingested to train public base models. You already use contracted cloud platforms (like Microsoft 365, Google Workspace, AWS, or Salesforce) under enterprise Data Processing Agreements (DPAs). * Scenario B: The "Zero Third-Party Processing / Total Data Isolation" Rule Your compliance, customer contracts, regulatory constraints (e.g., defense, healthcare enclaves, strict national sovereignty), or internal IP policies str…

The Arbiter's Final Verdict · gemini-3-7-flash

The Verdict If your team does not have dedicated AI engineers, jumping straight to self-hosting open-weight models is usually the wrong first step. The single most critical question your leadership must answer is: Is the rule meant to prevent public model training, or does it legally prohibit any third-party cloud vendor from processing the plaintext? --- 1. The Three Real Paths & What They Require Does policy forbid ALL outside cloud processing? / \ YES NO / \ Do you have physical servers & IT staff? Is extreme tenant isolation / \ required beyond standard SaaS? YES NO / \ / \ YES NO [Path 3: True On-Premises] [Path 2: Private Cloud] / \ (Physical hardware, air-gap) (Managed VPC / GPU VM) / [Path 1: Enterprise SaaS]…