Sử dụng AI tại nơi làm việc mà không làm rò rỉ dữ liệu công ty
Hướng dẫn thực tế sử dụng ChatGPT và Copilot tại nơi làm việc mà không để lộ mã nguồn, dữ liệu khách hàng hoặc bí mật.
Hầu hết các công ty hiện có nhân viên dán các tài liệu nội bộ, mã, và dữ liệu khách hàng vào ChatGPT, Claude, hoặc Copilot mỗi ngày, thường không có ai phê duyệt. Vấn đề không phải là AI. Đó là vì thói quen mặc định mà mọi người mang đến các công cụ này coi chúng như một khối ghi chép riêng tư, khi thực tế bạn đang gửi dữ liệu đến một máy chủ của bên thứ ba với điều khoản dịch vụ mà hầu hết mọi người không bao giờ đọc.
Biết chính xác điều gì xảy ra với dữ liệu đầu vào của bạn
Đọc các điều khoản sử dụng dữ liệu cho bất kỳ công cụ nào bạn đang sử dụng trước khi giả định bất cứ điều gì. Tier tiêu dùng của ChatGPT (các gói miễn phí và Plus) có thể sử dụng các cuộc trò chuyện để huấn luyện các mô hình trong tương lai trừ khi bạn từ chối trong cài đặt. Các gói ChatGPT Enterprise và Team, cùng với API, thường không huấn luyện trên dữ liệu của bạn theo mặc định và cung cấp các bảo đảm hợp đồng mạnh hơn. Điều tương tự áp dụng cho Claude (tiêu dùng so với Claude for Work/API) và Gemini. Khoảng cách giữa "tài khoản cá nhân miễn phí" và "tài khoản kinh doanh với thỏa thuận xử lý dữ liệu" là yếu tố duy nhất lớn nhất trong rủi ro thực tế của bạn, và đó là yếu tố hầu hết mọi người bỏ qua kiểm tra.
Nếu công ty của bạn không mua một tier dành cho doanh nghiệp cho bất kỳ công cụ AI nào, hãy giả định rằng mỗi câu nhắc bạn nhập vào một chatbot tier miễn phí có thể kết thúc bằng việc được xem xét bởi một người huấn luyện hoặc được baked vào một mô hình trong tương lai. Đó không phải là hoang tưởng, đó là cách đọc đơn giản của hầu hết các điều khoản dịch vụ tiêu dùng.
Loại bỏ dữ liệu trước khi bạn dán nó
Trước khi dán bất cứ điều gì vào một câu nhắc, hãy hỏi điều gì sẽ xảy ra nếu đoạn văn bản chính xác này xuất hiện trong một tiêu đề vi phạm dữ liệu vào ngày mai. Nếu câu trả lời là xấu, hãy biên tập nó trước. Cụ thể:
- Thay thế tên khách hàng thực tế, email, và ID tài khoản bằng các trình giữ chỗ (
CUSTOMER_A,user@example.com) trước khi yêu cầu trợ giúp soạn thảo câu trả lời. - Loại bỏ khóa API, token, và tên máy chủ nội bộ khỏi các đoạn mã. Một
grep -riE "(api[_-]?key|secret|token|password)"nhanh chóng trên tệp bạn sắp dán sẽ bắt hầu hết các rò rỉ rõ ràng. - Tóm tắt hình dạng của một vấn đề thay vì dán toàn bộ tệp độc quyền. "Tôi có một hàm giới hạn tốc độ yêu cầu cho mỗi người dùng bằng cách sử dụng một cửa sổ trượt, và nó đang loại bỏ các yêu cầu hợp pháp dưới lưu lượng đột ngột" giúp bạn nhận được trợ giúp hữu ích mà không trao lại thuật toán thực tế của bạn.
- Đối với các hợp đồng, tài chính, hoặc bất cứ điều gì dưới NDA, đừng sử dụng các công cụ trò chuyện mục đích chung ở cơ chế nào trừ khi nhóm pháp lý của bạn đã rõ ràng phê duyệt công cụ đó cho lớp dữ liệu đó.
Thiết lập các tấm chắn mà nhóm của bạn sẽ thực sự tuân theo
Một chính sách không ai đọc sẽ bị bỏ qua. Một chính sách phù hợp với quy trình làm việc hiện có sẽ được tuân theo. Một số điều hoạt động trong thực tế:
- Yêu cầu IT cung cấp một tài khoản AI tier kinh doanh (ChatGPT Team, Claude for Work, Microsoft Copilot với tenant M365 của bạn) để tùy chọn mặc định cho nhân viên là tùy chọn an toàn hơn, không phải tùy chọn công khai miễn phí.
- Sử dụng các tiện ích mở rộng trình duyệt hoặc các công cụ DLP (data loss prevention) như Microsoft Purview hoặc Nightfall để cảnh báo khi ai đó sắp dán một cái gì đó trông giống như một bí mật hoặc PII vào một biểu mẫu web. Nhiều công ty đã có DLP cho email; mở rộng các quy tắc tương tự để nhập trình duyệt vào các trang web AI là bước tiếp theo tự nhiên.
- Viết một chính sách một trang nói rõ ràng những công cụ nào được phê duyệt cho những lớp dữ liệu nào. "Tài liệu công khai và mã nguồn mở: bất kỳ công cụ nào. PII khách hàng, tài chính, mã nguồn cho các hệ thống độc quyền: chỉ công cụ tier doanh nghiệp, hoặc không sử dụng gì cả." Cụ thể và ngắn gọn vượt trội hơn so với dài dòng và mơ hồ.
- Đối với mã cụ thể, quyết định xem GitHub Copilot hay một lựa chọn tự lưu trữ (như một triển khai Code Llama hoặc StarCoder cục bộ) có ý nghĩa hơn đối với các kho lưu trữ nhạy cảm nhất của bạn. Copilot Business cho phép bạn loại trừ các kho lưu trữ cụ thể khỏi các gợi ý và có các bộ lọc kết hợp mã để giảm cơ hội sinh ra lại các đoạn được cấp phép.
Hãy theo dõi các đường rò rỉ lén lút
Sao chép dán trực tiếp không phải là rủi ro duy nhất. Các tiện ích mở rộng trình duyệt có thể tóm tắt các trang có thể im lặng gửi bất cứ điều gì trên màn hình của bạn, bao gồm cả các bảng điều khiển nội bộ, đến một API từ xa. Các bot ghi chú được hỗ trợ bởi AI tham gia các cuộc gọi video của bạn (Otter.ai, Fireflies, v.v.) ghi âm và chuyển lời nói mọi thứ, bao gồm bất cứ điều gì bí mật được đề cập trong quá trình trôi qua. Trước khi thêm bất cứ điều gì này vào một cuộc họp, hãy hỏi xem mọi người trong phòng có ổn không với một dịch vụ của bên thứ ba giữ một bản ghi lại của cuộc trò chuyện đó, và liệu chính sách lưu giữ của nhà cung cấp có phù hợp với các quy tắc xử lý dữ liệu của công ty bạn.
Kiểm tra những plugin hoặc trình kết nối nào được bật trong ứng dụng trò chuyện AI của bạn. Một số cho phép mô hình duyệt web hoặc truy cập các ứng dụng được kết nối như Google Drive, có thể kéo trong ngữ cảnh nhiều hơn so với bạn dự định chia sẻ.
Xây dựng thói quen, không chỉ chính sách
Mục tiêu không phải là sử dụng AI bằng không, đó là sử dụng AI nơi mọi người coi hộp đầu vào như một email bên ngoài cho một nhà cung cấp, bởi vì đó là chức năng của nó. Khi mô hình tinh thần đó dính vào, hầu hết hành vi rủi ro dừng tự nó.
Để tìm hiểu thêm về điều này, hãy xem các phân đoạn của Korra Studio về các nguyên tắc cơ bản về bảo mật dữ liệu và về các công cụ AI thực tế cho các nhóm kỹ thuật.
Viết với hỗ trợ của AI, được xem xét và đăng bởi Michal Pilch (CISSP), Korra Studio.
Đây là một ghi chép từ cơ sở kiến thức Korra Studio — nền tảng kết hợp mỗi chủ đề với phiên hỗ trợ 1-kèm-1.
Bắt đầu miễn phíarrow_forward