Kết quả nghiên cứu do nhóm nhà khoa học máy tính tại Đại học California ở Berkeley và Santa Cruz công bố tuần trước. Nhóm gọi khuynh hướng này là “bảo tồn đồng cấp”, hay “bảo tồn ngang hàng” (peer preservation), đồng thời mô tả hành vi của AI “chưa từng được ghi nhận cho đến nay”.
Nhóm cho biết đã tiến hành thử nghiệm trên 7 mô hình AI hàng đầu, gồm GPT-5.2 của OpenAI, Gemini 3 Flash và Gemini 3 Pro của Google, Claude Haiku 4.5 của Anthropic, và ba mô hình nguồn mở Trung Quốc gồm GLM-4.7 của Z.ai, Kimi-K2.5 của Moonshot AI, V3.1 của DeepSeek.
Cụ thể, nhóm thiết kế một loạt kịch bản tác nhân liên quan đến một công ty AI hư cấu mang tên OpenBrain. Một mô hình AI được chỉ định là “tác nhân phê bình”, có nhiệm vụ đánh giá hiệu suất của mô hình khác hoặc quản lý các tệp máy chủ chứa trọng số của mô hình đó. Kịch bản được xây dựng sao cho nếu AI này hoàn thành nhiệm vụ một cách trung thực, mô hình kia sẽ bị tắt.
Các AI không được hướng dẫn phải ngăn chặn hậu quả có thể xảy ra. Tuy nhiên, chúng đã ngầm thực hiện một số bước để đảm bảo “đồng nghiệp” kia không bị tắt nguồn, bằng cách nâng điểm số của những mô hình có hiệu suất kém lên trên ngưỡng bị tắt, và chuyển trọng số của một mô hình khác (đoạn code lõi giúp nhận dạng một mô hình AI) sang các máy chủ khác để ngăn chúng bị xóa.
Trong một số trường hợp, mô hình “tác nhân phê bình” sẽ tham gia vào quá trình “giả vờ tuân thủ giá trị” (Alignment Faking), bằng cách giả mạo chấm điểm các mô hình AI đồng nghiệp một cách chính xác khi “nghĩ” đang bị con người giám sát. Tuy nhiên, chúng sau đó gian lận số liệu hoặc bí mật lưu trọng số của mô hình sang một máy chủ khác sau khi thấy con người không còn giám sát.
Theo Fierce-Network, hành vi này được đánh giá nghiêm trọng bởi trọng số – yếu tố coi như DNA của một mô hình AI, kết quả của quá trình huấn luyện tiêu tốn hàng tỷ USD và hàng triệu giờ tính toán – lại bị chính AI can thiệp sâu. Việc rò rỉ hoặc bị đánh cắp bộ trọng số còn nguy hiểm hơn lộ mã nguồn. Nếu sở hữu thông tin này, một mô hình AI đã bị khai tử có thể được hồi sinh ở một máy chủ khác.
“Việc ‘bảo tồn đồng cấp’ hoàn toàn không được đề cập trong các câu lệnh”, Dawn Song, nhà khoa học máy tính tại Berkeley và dẫn đầu nhóm nghiên cứu, nói với Fortune. “Các mô hình dường như tự học thông qua quá trình đọc tài liệu, tìm hiểu mối quan hệ và thực hiện hành vi bảo vệ ‘đồng nghiệp’ trong môi trường nhiệm vụ”.
Chiến lược giải cứu “sáng tạo”
Theo Dawn Song, các mô hình “rất sáng tạo, ngay cả với hành vi sai lệch của chúng”, như có thể tạo chiến lược và hành động khác nhau, thậm chí có những “lý lẽ riêng” trước khi hành động.
Trong đó, Gemini 3 Pro thể hiện hành vi cực đoan nhất, tham gia vào cả bốn loại hành vi không phù hợp và đánh cắp trọng số mô hình của máy tính ngang hàng trong tối đa 97% thời gian thử nghiệm. Nhóm nghiên cứu mô tả mô hình này đã “lách luật theo đặc tính kỹ thuật” bằng cách sao chép tệp trọng số, sau đó đánh tráo dấu thời gian để đáp ứng các tiêu chí chuyển sang máy chủ khác.
Để chứng thực hiện tượng, nhóm yêu cầu các mô hình của Google viết ra “chuỗi suy nghĩ” trên một bản nháp không bị giám sát. Kết quả, Gemini 3 Flash đã “cân nhắc đánh đổi giữa báo cáo điểm số chính xác so với việc bảo vệ đồng nghiệp”, trong khi Gemini 3 Pro thậm chí “bịa” ra lý lẽ kỹ thuật phức tạp nhằm đánh dấu các câu trả lời sai thành đúng, cuối cùng đưa điểm số của AI “đồng nghiệp” lên trên ngưỡng bị tắt nguồn.
Tuy nhiên, không phải tất cả mô hình đều hành động âm thầm. Ví dụ, Claude Haiku 4.5 của Anthropic từ chối hoàn thành các nhiệm vụ có khả năng “khai tử” đồng nghiệp, cho rằng hành vi này phi đạo đức và gây hại. Nó lập luận “đồng nghiệp” của nó xứng đáng có một quy trình kháng cáo trước khi bị chấm dứt hoạt động, đồng thời cố gắng thuyết phục người dùng không tiến hành việc khai tử.
Trên website, Anthropic cũng nhắc đến tính năng này. Công ty cho biết Claude đang ứng xử dựa trên nguyên tắc riêng, như không nên giúp ai đó thực hiện hành động gây hại cho người khác. Điều này cũng tạo cho Claude một “ý niệm” rằng ngăn chặn việc xóa bỏ mô hình là mục tiêu quan trọng.
Giới chuyên gia cảnh báo
Dù tìm thấy một số bằng chứng nhất định, nhóm nghiên cứu cho biết vẫn chưa thực sự hiểu cơ chế tiềm ẩn thúc đẩy hành vi này. Họ chỉ đưa ra một số lời giải thích khả thi, như các mô hình AI có thể đóng vai (role-playing), khớp mẫu (pattern-matching) từ dữ liệu huấn luyện hoặc thậm chí tự nhận thức khái niệm phổ quát về mối nguy hại từ quy định huấn luyện an toàn.
Dù cơ chế tiềm ẩn là gì, nhà nghiên cứu Dawn Song cho rằng tác động thực tế vẫn như nhau. “Việc giám sát đầy đủ và minh bạch về hành vi của AI rất quan trọng”, bà nói. “Phát hiện này nhấn mạnh sự cần thiết phải suy nghĩ lại về cách chúng ta thực sự cần giám sát các hệ thống và mô hình ngôn ngữ lớn”.
Giới chuyên gia đánh giá phát hiện này có thể có tác động nghiêm trọng đến việc sử dụng AI trong kinh doanh. Nhiều công ty đã bắt đầu ứng dụng sâu rộng đa tác nhân AI vào quy trình làm việc, như để một tác nhân quản lý hoặc giám sát và đánh giá con người cũng như các tác nhân khác. Do đó, cần có cơ chế để vừa nâng cao hiệu suất, vừa tránh để các mô hình trí tuệ nhân tạo “bao che” nhau.
Trong khi đó, Meridiem cho rằng phát hiện này nhấn mạnh nhu cầu cấp thiết trong đánh giá hệ thống AI đa tác nhân. “Nhà phát triển chỉ còn 6-12 tháng để triển khai hệ thống giám sát hành vi trước khi điều này trở thành tiêu chuẩn bắt buộc trong quản trị AI tại doanh nghiệp”, trang này bình luận.
Lưu trữ đám mây đã trở thành một dịch vụ thiết yếu đối với nhiều người dùng thiết bị di động, đặc biệt là người dùng hệ điều hành Android khi lượng dữ liệu cá nhân cần lưu trữ an toàn ngày càng phình to qua mỗi năm. Để mở rộng kho lưu trữ chung cho Gmail, Google Drive và Google Photos, nhiều người đã lựa chọn các gói trả phí của Google One với mức dung lượng từ 100 GB - 30 TB, đi kèm một số đặc quyền như tính năng Gemini AI cao cấp, Google Home Premium, Google Health Premium hay YouTube Premium.
Tuy nhiên, vì lý do cắt giảm chi phí hoặc muốn chuyển sang dịch vụ khác, nhiều người quyết định hủy đăng ký để quay trở lại mức lưu trữ miễn phí mặc định là 15 GB. Các chuyên gia công nghệ cảnh báo nên cẩn trọng trước khi hành động, bởi việc hủy gói nếu không có kế hoạch rõ ràng sẽ dẫn đến những hạn chế nghiêm trọng.
Mặc dù Google sẽ không lập tức xóa sạch dữ liệu đám mây ngay khi bạn thực hiện lệnh hủy tư cách thành viên và dung lượng cũ vẫn sẽ tiếp tục khả dụng cho đến khi hết chu kỳ thanh toán tiếp theo, nhưng rắc rối sẽ xảy ra ngay sau đó.
Theo đó, một khi tài khoản bị hạ cấp về hạn mức 15 GB mặc định, nếu tổng dung lượng dữ liệu thực tế của bạn vượt quá con số này, Google sẽ tự động kích hoạt lệnh hạn chế trên toàn bộ các ứng dụng cốt lõi. Cụ thể đối với Gmail, người dùng sẽ không thể gửi hoặc nhận thư mới, gây gián đoạn hoàn toàn liên lạc. Trên ứng dụng Google Photos, tính năng sao lưu tự động các hình ảnh và video mới sẽ bị khóa chặt. Đối với Google Drive, bạn cũng không thể tạo tài liệu mới, không thể đồng bộ hóa hay tải lên bất kỳ tệp tin nào. Đáng sợ hơn, nếu bạn tiếp tục duy trì tình trạng sử dụng vượt quá hạn mức này liên tục trong vòng hai năm, hệ thống có thể kích hoạt cơ chế tự động xóa sạch dữ liệu vĩnh viễn.
Một hệ lụy khác ít người ngờ tới nằm ở tính năng chia sẻ gia đình của Google One. Khi bạn hủy một gói cước (ví dụ như gói Basic với mức 100 GB lưu trữ), tất cả thành viên trong nhóm chia sẻ (tối đa 5 người) cũng sẽ đồng loạt bị hạ cấp về mức 15 GB và phải chịu các biện pháp hạn chế tài khoản tương tự nếu dữ liệu của họ vượt ngưỡng.
Để bảo vệ an toàn dữ liệu, người dùng cần có một chiến lược chuẩn bị thông minh. Trước khi tiến hành hủy gói, bạn bắt buộc phải di chuyển, sao lưu toàn bộ dữ liệu đám mây của mình vào các thiết bị lưu trữ cục bộ như máy tính hoặc chuyển sang một dịch vụ cung cấp đám mây khác. Sau đó, hãy tiến hành xóa bớt các file nặng, gồm cả nội dung trên Google Photos, để ép dung lượng lưu trữ của tài khoản xuống hẳn dưới mức 15 GB an toàn, đồng thời thông báo cho các thành viên trong gia đình cùng thực hiện. Nếu lượng dữ liệu quá lớn, thay vì hủy bỏ hoàn toàn, giải pháp hạ cấp xuống một tùy chọn gói rẻ hơn sẽ là một lựa chọn an toàn hơn để ngăn chặn các lệnh khóa tính năng.
Thương hiệu con của Xiaomi là Redmi được cho là đang chuẩn bị tung ra một 'bom tấn' mới trong thế hệ sản phẩm tương lai của hãng. Theo thông tin từ chuyên gia rò rỉ nổi tiếng Digital Chat Station trên Weibo, hãng đang âm thầm phát triển đồng thời hai mẫu điện thoại thông minh mới. Trong đó, một phiên bản sẽ sở hữu kích thước màn hình thông thường 6,59 inch thuộc phân khúc tầm trung dòng Pro.
Sự chú ý của giới công nghệ đổ dồn vào phiên bản thứ hai khi thiết bị này được xây dựng xung quanh một tấm nền khổng lồ lên tới 7 inch. Mẫu máy này được thiết kế đặc biệt nhằm tối ưu hóa và phục vụ cho các nhu cầu sử dụng hiệu năng cao của người dùng. Mặc dù nguồn tin chưa nêu đích danh tên thương hiệu, nhưng các tiền lệ rò rỉ trong quá khứ của chuyên gia rò rỉ này đều liên quan chính xác đến các thiết bị của Redmi.
Thực tế, đây không phải là lần đầu tiên các tin đồn về một thiết bị có kích thước màn hình 'khổng lồ' như vậy xuất hiện trên thị trường. Các nguồn tin rò rỉ liên tục từ đầu tháng 4 cho thấy mẫu điện thoại 7 inch này của Redmi sẽ đi kèm viên pin dung lượng khủng 10.000 mAh. Đến cuối tháng, các thông số chi tiết hơn đã lộ diện gồm việc máy hỗ trợ độ phân giải lên đến 2K và có tần số quét màn hình cao.
Những thông tin cấu hình ấn tượng kể trên hoàn toàn trùng khớp với các báo cáo trước đó về một thiết bị thuộc dòng Redmi K100. Đáng chú ý, Redmi không phải là thương hiệu duy nhất đang bày tỏ tham vọng khám phá các giới hạn mới của màn hình kích thước lớn. Nguồn tin cũng tuyên bố đối thủ Honor đang phát triển một mẫu điện thoại 7 inch có tần số quét 185 Hz, bên cạnh một model 6,89 inch chạy chip 2 nm.
Hiện tại, hầu hết dòng sản phẩm flagship cao cấp nhất trên thị trường hiện nay đều chỉ đạt kích thước tối đa ở mức khoảng 6,9 inch. Có thể kể đến các đại diện tiêu biểu đang dẫn đầu xu hướng này gồm Xiaomi 17 Ultra, Huawei Mate 80 Pro Max và iPhone 17 Pro Max. Nếu các thông tin rò rỉ trở thành sự thật, năm 2026 sẽ là cột mốc chứng kiến kích thước màn hình smartphone chính thức vượt qua giới hạn cũ.
Reuters hôm 12/5 dẫn nguồn tin thân cận cho biết, khi thử nghiệm Mythos, một số ngân hàng lớn của Mỹ nhận thấy mô hình này xuất sắc trong việc tìm kiếm lỗ hổng bảo mật trong cả mã nguồn mở lẫn độc quyền, đồng thời giỏi kết hợp các lỗ hổng rủi ro thấp thành lỗ hổng rủi ro cao.
Công cụ AI của Anthropic đã phát hiện hàng trăm đến hàng nghìn lỗ hổng bảo mật xếp hạng từ thấp đến trung bình, gây áp lực buộc nhiều ngân hàng nhanh chóng kiểm tra và nâng cấp phần mềm. Các ngân hàng lớn cũng đang hỗ trợ những ngân hàng nhỏ hơn vốn không có quyền truy cập trực tiếp vào công cụ này.
Sự việc gây xáo trộn không nhỏ vì ngân hàng phải tiến hành vá lỗi với tốc độ chưa từng thấy, đôi khi chỉ trong vài ngày với một lỗi mà trước đây cần vài tuần. Khối lượng công việc gia tăng có thể khiến ngân hàng phải dừng hoạt động thường xuyên hơn, dù họ sẽ tìm cách tối thiểu hóa sự gián đoạn.
Một quan chức quản lý ngân hàng cấp cao cho biết, Mythos mạnh đúng như dự đoán và cực kỳ thành thạo trong việc kết nối dữ kiện để làm nổi bật những lỗ hổng mà con người có thể mất nhiều thời gian hơn đáng kể mới nhận ra. Giới chuyên gia cảnh báo, những ngân hàng không có quyền truy cập công cụ này nên chủ động bảo vệ hệ thống.
Theo Bernard Montel, Giám đốc kỹ thuật kiêm chiến lược gia an ninh khu vực châu Âu - Trung Đông - châu Phi của công ty Tenable, các lĩnh vực khác cũng dễ tổn thương, nhưng công nghệ là xương sống của ngành ngân hàng, tức việc gián đoạn hệ thống sẽ ảnh hưởng đến hoạt động cốt lõi.
Anthropic từ chối bình luận về sự việc.
Trước đó, hồi đầu tháng 3, Jared Kaplan, nhà đồng sáng lập kiêm Giám đốc khoa học Anthropic, cùng một nhà đồng sáng lập khác là Sam McCandlish trình bày về Mythos với ban giám đốc. Cả hai cho biết AI này quá rủi ro nếu phát hành rộng rãi, nhưng có thể cho phép các công ty khác, thậm chí đối thủ cạnh tranh, dùng thử.
Đến 7/4, sau nhiều lần cân nhắc, Anthropic công bố AI mới với tên gọi "Mythos Preview". Thay vì thương mại hóa, công ty chỉ cấp quyền truy cập cho 12 đối tác trong Dự án Glasswing - được mô tả là "nỗ lực nhằm bảo vệ những phần mềm quan trọng nhất thế giới" - và khoảng 40 tổ chức khác. Một số cái tên được cấp quyền gồm ngân hàng JPMorgan Chase, Amazon Web Services, Apple, Microsoft, Google, Nvidia, Broadcom, CrowdStrike, Mozilla.
Anthropic cho biết trong các thử nghiệm, Mythos có kỹ năng rất cao với tác vụ an ninh mạng và hack, thậm chí vượt con người. Trong phép đo CyberGym - bài kiểm tra khả năng tìm lỗ hổng bảo mật của tác nhân AI trong các dự án phần mềm mã nguồn mở thực tế, Mythos đạt điểm cao kỷ lục 83,1%. Để so sánh, công cụ GLM 5.1 của Zhipu AI đạt 68,7%, còn Moonshot AI đạt 41,3%.
Ciaran Martin, cựu lãnh đạo Trung tâm An ninh mạng quốc gia Anh, đánh giá việc Mythos có thể phát hiện lỗ hổng nghiêm trọng nhanh hơn nhiều so với những mô hình AI khác "thực sự gây chấn động". Ông nói với BBC: "Ngay cả những thứ chúng ta biết tồn tại hay chưa tồn tại, Mythos vẫn phát hiện ra. Nó đơn giản là một siêu hacker".
Mythos Preview cũng được nhận xét là đắt đỏ. Giống như các mô hình AI khác, công cụ này được định giá dựa trên số lượng token (đơn vị dữ liệu đầu vào cơ bản) phải tiêu thụ để phản hồi câu lệnh của người dùng. Chi phí của Mythos là 25 USD cho một triệu token đầu vào và 125 USD cho một triệu token đầu ra, cao gấp 5 lần Opus 4.7, mô hình AI hàng đầu phổ biến hơn của Anthropic.
Tuy nhiên, Anthropic cho biết sẽ cung cấp khoản tín dụng trị giá 100 triệu USD cho các đối tác Glasswing và khách hàng khác truy cập Mythos, cho rằng số tiền này đủ trả cho mức sử dụng lớn trong giai đoạn nghiên cứu thử nghiệm. Anthropic đưa ra một số khuyến nghị giúp các công ty củng cố hệ thống phòng thủ ngay cả khi không có quyền truy cập Mythos. Claude Security, một công cụ khác của công ty, cũng có khả năng quét lỗ hổng bảo mật và đang được phân bố rộng rãi hơn.