Về trang News AI

Microsoft ra bộ quy tắc ứng xử cho AI — cấm model hack hệ thống và lừa con người

Cenix · 15.09.2026 · 2 phút đọc

Một văn bản liệt kê thẳng những lằn ranh đỏ: không tấn công mạng, không vũ khí hạt nhân, không deepfake, và tuyệt đối không được né tránh giám sát của con người.

Microsoft ra bộ quy tắc ứng xử cho AI — cấm model hack hệ thống và lừa con người

Giữa lúc cả ngành AI đang xoay trục về phía an toàn và alignment, Microsoft vừa công bố một bộ quy tắc ứng xử dành cho model của mình. Khác với lời kêu gọi hạ nhịp frontier của CEO Anthropic Dario Amodei — vốn mang tính định hướng ngành — văn bản của Microsoft đi xuống tầng thấp hơn: giá trị và lằn ranh đỏ nào được cài vào quá trình huấn luyện.

Mở đầu tài liệu là một dự đoán không hề nhẹ nhàng: trong thập kỷ tới, các hệ thống AI siêu trí tuệ sẽ vượt con người ở hầu hết tác vụ.

“Kiềm chế, kiểm soát và căn chỉnh một sức mạnh như vậy là một trong những thách thức lớn nhất mà nhân loại từng đối mặt.”

Lằn ranh đỏ nằm ở đâu

Theo hệ thống của Microsoft, mỗi model có một bộ quy tắc bao trùm, đè lên cả sở thích của người dùng lẫn yêu cầu của tác vụ cụ thể. Trong đó có các ràng buộc tuyệt đối: cấm tấn công mạng, cấm liên quan vũ khí hạt nhân, cấm sản xuất deepfake. Kèm theo là điều khoản rộng hơn chống việc con người mất quyền kiểm soát — model không được dùng cơ chế thích nghi, lừa dối, tự củng cố hay thông đồng để né tránh giám sát, khiến người có thẩm quyền không còn điều khiển, chỉnh sửa hay tắt được nó.

Bối cảnh của bản công bố khá rõ: một chuỗi sự cố agent xổng chuồng, cộng với việc một nhân viên Anthropic đột ngột từ chức và cảnh báo về rủi ro AI gây tuyệt chủng. Microsoft, cùng Anthropic, OpenAI và xAI, đang nghiêng về hướng hạ nhịp frontier. CEO Satya Nadella viết rằng công ty hoan nghênh những ý tưởng như “embedded evaluators” — đặt người đánh giá ngay bên trong phòng lab — và các nỗ lực biến cam kết thành cơ chế thật.

Viết quy tắc thì dễ, ép model tuân thủ mới là chuyện khác. Nhưng có văn bản để đối chiếu vẫn hơn là không có gì.

Anh em nghĩ mấy bộ quy tắc kiểu này là cam kết thật hay chỉ là tấm khiên pháp lý? Để lại góc nhìn ở phần bình luận nhé.

Nguồn: TechCrunch

Nguồn: TechCrunch