Liệu AI có nên chịu các hạn chế về quyền truy cập dữ liệu giống như một nhân viên hay không?
Nhân sự có thể không được phép xem dữ liệu nhạy cảm, nhưng liệu trợ lý AI có vô tình hiển thị dữ liệu đó cho họ không?
Để khai thác tối đa tiềm năng của các hệ thống generative AI và agentic AI, các doanh nghiệp đang cấp cho chúng các quyền truy cập rộng rãi vào dữ liệu kinh doanh. Tuy nhiên, quá trình này không đơn thuần là việc mở toang cánh cửa dữ liệu và để AI tự vận hành; nó đặt ra những vấn đề quản trị quan trọng mà các CIO cần phải giải quyết.
Ví dụ, nếu một nhân viên không có quyền truy cập một tài liệu cụ thể, liệu họ có thể lấy được nội dung tài liệu đó bằng cách yêu cầu một AI tool hay không? Các cơ chế kiểm soát truy cập truyền thống quy định cách người dùng truy cập thông tin tại nơi thông tin được lưu trữ ban đầu. Tuy nhiên, hệ thống AI có thể sử dụng thông tin đã được sao chép từ các hệ thống nguồn và lưu trữ trong data lake hoặc vector database.
Điều này có thể tạo ra khoảng cách giữa quyền truy cập được áp dụng cho dữ liệu nguồn và thông tin mà hệ thống AI có thể truy xuất để trả lời câu hỏi của người dùng. Vậy các vấn đề liên quan đến những thông tin như hồ sơ nhân sự, dữ liệu tiền lương, thông tin sức khỏe bệnh nhân và sở hữu trí tuệ thì sao?
Hoàn toàn có khả năng một nhân viên không được phép truy cập bảng tính lương của công ty trong điều kiện thông thường. Nhưng nếu dữ liệu đó được đưa vào nguồn dữ liệu của hệ thống AI nội bộ mà không giữ lại các quy tắc phân quyền ban đầu, nhân viên đó vẫn có thể yêu cầu hệ thống cung cấp thông tin về tiền lương và nhận được câu trả lời.
Cách AI khai thác dữ liệu doanh nghiệp
Để hiểu cơ chế này, cần xem xét cách các hệ thống AI truy cập dữ liệu doanh nghiệp. Thông thường, các mô hình ngôn ngữ lớn (LLM) có một mốc thời gian giới hạn dữ liệu huấn luyện; do đó, chúng có thể không tự động truy cập được các thông tin được tạo ra sau thời điểm đó.
Tuy nhiên, các doanh nghiệp ngày nay hoạt động dựa nhiều vào dữ liệu, đòi hỏi các hệ thống AI phải được cập nhật liên tục. Giải pháp cho nút thắt tiềm ẩn về thông tin này là chuyển đổi các thông tin mới hoặc thông tin nội bộ thành dạng biểu diễn số và lưu trữ trong vector database.
Khi người dùng đặt câu hỏi liên quan đến dữ liệu đó, công nghệ RAG có thể tìm kiếm thông tin phù hợp và đưa thông tin này vào phản hồi của AI. Từ đó hệ thống AI nội bộ tcó thể có được sự am hiểu về các thông tin mới nhất hoặc thông tin đặc thù của tổ chức mà không cần phải huấn luyện lại mô hình nền tảng. Quan trọng hơn, các quyết định về việc dữ liệu nào được đưa vào vector database có thể định hình kết quả đầu ra của AI sau đó.
Trong trường hợp này, nhân viên không cần phải mở trực tiếp bảng tính lương. Họ chỉ cần đặt câu hỏi để kích hoạt hệ thống AI truy xuất thông tin liên quan từ bảng tính đó và tạo ra câu trả lời. Chính vì vậy, các biện pháp kiểm soát chỉ áp dụng cho tệp tin gốc có thể không còn đủ hiệu quả.
Điều này không có nghĩa là bản thân mô hình AI thiếu an toàn; vấn đề nằm ở quy trình xử lý dữ liệu cung cấp cho nó. Hệ thống AI không "biết" ai được phép xem nội dung nào; nó chỉ đơn thuần truy xuất bất kỳ nội dung nào trong vector database có vẻ liên quan đến truy vấn. Nếu được triển khai đúng cách, quy trình này sẽ duy trì các quyền truy cập ban đầu ở mọi giai đoạn: từ lúc dữ liệu được nạp vào từ các hệ thống nguồn, khi được index để truy xuất, cho đến khi AI tạo phản hồi; nhờ đó, hệ thống chỉ trả về những nội dung mà người dùng có thẩm quyền được phép xem. Khi việc mapping quyền truy cập được thực hiện chuẩn xác, hệ thống AI sẽ không gây ra rủi ro quản trị lớn hơn so với một hệ thống search index được cấu hình tốt. Thách thức mà các CIO cần giải quyết là đảm bảo quá trình mapping này diễn ra một cách nhất quán, thay vì mặc định rằng nó sẽ tự động được thực hiện.
Tích hợp cơ chế quản trị vào quy trình vận hành AI
Một vấn đề quan trọng khác là dữ liệu cung cấp cho hệ thống AI có thể ảnh hưởng đến độ chính xác của các câu trả lời, và do đó, ảnh hưởng đến cả thông tin mà hệ thống này cung cấp. Trong một vụ việc tại Canada, một hội đồng xét xử đã quy trách nhiệm cho hãng hàng không Air Canada, sau khi chatbot trên website của hãng này đưa ra thông tin sai lệch về chính sách giá vé dành cho trường hợp hành khách có người thân qua đời.
Chatbot đã thông báo với hành khách rằng ông có thể nộp đơn xin hưởng ưu đãi giảm giá sau khi đã mua vé và hoàn tất chuyến đi. Tuy nhiên, chính sách bằng văn bản của Air Canada về việc đi lại do có người thân qua đời lại quy định rằng không thể gửi yêu cầu sau khi hành trình đã kết thúc. Hành khách này đã tin vào thông tin từ chatbot, sau đó đệ đơn khiếu nại khi Air Canada từ chối áp dụng mức giảm giá, và cuối cùng đã thắng kiện. Như Hiệp hội Luật sư Hoa Kỳ từng nhận định vào thời điểm đó: "Các công ty vẫn phải chịu trách nhiệm về hành động của các công cụ AI do mình vận hành, đồng thời cần thiết lập các chính sách nội bộ phù hợp để đảm bảo độ chính xác cũng như giải quyết các vấn đề liên quan khác."
Giải pháp cho các vấn đề quan trọng này nằm ở vấn đề quản trị hiệu quả hơn. Điểm khởi đầu chính là dữ liệu nguồn, cùng với các quy tắc và quy trình được áp dụng trước khi thông tin được sao chép vào data lake hoặc được cung cấp cho hệ thống AI. Điều này chỉ có thể thực hiện được nếu có sự thống kê rõ ràng về các file và object lưu trữ trên các hệ thống nguồn có liên quan. Khi đó, dữ liệu có thể được lựa chọn dựa trên các yếu tố như vị trí, loại file, ngày tạo hoặc mức độ phù hợp với trường hợp sử dụng AI dự kiến, cùng nhiều cân nhắc khác.
Cùng với đó, các thông tin đã cũ hoặc loại file không liên quan đến mục đích sử dụng AI dự kiến có thể được loại bỏ trước khi dữ liệu được sao chép sang bước tiếp theo. Dữ liệu đã chọn có thể được lưu trữ tại một khu vực chuyên biệt trong data lake để tiếp tục xử lý. Việc duy trì các log về hoạt động di chuyển này giúp ghi lại những thông tin nào đã được đưa vào quy trình xử lý AI ở các bước sau. Nếu sau này cần đến lời giải trình hoặc bằng chứng về hoạt động, hồ sơ đó sẽ hỗ trợ quá trình truy xuất nguồn gốc để xác định cách thức một tài liệu cụ thể được đưa vào hệ thống AI.
Lý tưởng nhất là trước khi phê duyệt một sáng kiến AI mới, các CIO cần đặt ra một số câu hỏi quan trọng. Ví dụ, hệ thống sẽ có thể truy cập những thông tin nào và nguồn gốc của chúng từ đâu? Doanh nghiệp đã xác định thông tin đó phù hợp với trường hợp sử dụng dự kiến như thế nào? Liệu thông tin có còn được cập nhật hay không? Các dữ liệu đã lỗi thời hoặc không cần thiết đã được loại bỏ chưa?
Mục tiêu cần đạt được là đảm bảo rằng các quyền hạn áp dụng cho tài liệu gốc vẫn được duy trì khi hệ thống AI tìm kiếm và trả về thông tin. Nếu thiếu các biện pháp kiểm soát này, một công cụ AI nội bộ có thể vô tình vượt qua các cơ chế kiểm soát truy cập hiện hành vốn rất quan trọng một cách dễ dàng.



























