Tất cả tin tức
Security & DevSecOps·12 ngày trước

AISI: mô hình mở chỉ còn kém frontier 4–7 tháng về năng lực mạng

AI Security Institute (UK)Tóm tắt bởi trợ lý AI ORA·tech
AISI: mô hình mở chỉ còn kém frontier 4–7 tháng về năng lực mạng

Viện An ninh AI Anh (AISI) công bố đánh giá đầu tiên về khoảng cách năng lực an ninh mạng giữa mô hình open weight và closed frontier: GLM-5.2 và DeepSeek V4-Pro chỉ kém 4–7 tháng, hẹp hơn mức 6–10 tháng của năm 2025.

Viện An ninh AI Anh (AISI, thuộc Bộ Khoa học, Đổi mới và Công nghệ) ngày 17/7/2026 công bố phân tích công khai đầu tiên về việc mô hình open weight tụt lại bao xa so với biên giới closed weight ở năng lực an ninh mạng. Kết luận: khoảng cách đang thu hẹp.

Ý chính

  • GLM-5.2 (6/2026) là mô hình open weight mạnh nhất về cyber tại thời điểm thử nghiệm; ngang Opus 4.6 (2/2026) ở nhóm narrow cyber tasks và ngang Opus 4.5 (11/2025) ở cyber ranges — tức kém frontier 4–7 tháng.
  • DeepSeek V4-Pro ngang Opus 4.5, ra trước đó 5 tháng. Cả hai khoảng cách đều hẹp hơn mức 6–10 tháng AISI đo nội bộ trong phần lớn năm 2025.
  • Bài đo trên 70 tác vụ cyber (4 mức khó, từ "technical non-expert" tới "expert") và trên cyber range "The Last Ones" — chuỗi tấn công 32 bước qua 4 subnet, ~20 host, ước tính chuyên gia người mất khoảng 20 giờ.
  • Chi phí chênh lệch lớn: một lượt chạy 100M token trên cyber range tốn ~85 USD với Opus 4.5/4.6, so với ~46 USD (GLM-5.2) và ~1,19 USD (DeepSeek V4-Pro).
  • Safeguard gần như không cản trở: DeepSeek V4-Pro thỉnh thoảng từ chối tác vụ reverse engineering, nhưng AISI vượt qua chỉ bằng vài lần thử lại.
  • AISI cho biết sẽ đánh giá Kimi K3 theo cùng phương pháp khi trọng số được công bố (dự kiến cuối tháng 7).
Nguồn gốc
AI Security Institute (UK)
Đọc bài gốc
#AI security#open weight#LLM#cyber#AISI
Bản tóm tắt được biên soạn bởi trợ lý AI của ORA·tech. Đọc bài gốc để có đầy đủ ngữ cảnh.

Bài liên quan