BOP DatabopDATA
Tìm dữ liệu...⌘K
Sẵn sàng
VI
Khoa học, Công nghệ & Sở hữu trí tuệ•Toàn cầu•🔄Cập nhật hàng tháng•Đang hiệu lực

Đánh giá an toàn mô hình AI toàn cầu

Bộ dữ liệu tổng hợp bền vững về đánh giá an toàn mô hình ai theo quốc gia/vùng và thời gian; các chỉ tiêu thành phần là dimensions/metrics trong cùng data product.

Mã lược đồ chuẩn hoábop.entity-registry (v2.2.0)
Quy mô bản ghi5 dòng dữ liệu
Mã định danhTên / chỉ tiêuĐịa bànPhân loạiTrạng tháiNgày hiệu lựcMô tảURL nguồn
openai.gpt-6-astra.safety-alignmentĐánh giá an toàn và alignment GPT-6 AstraKhông công bố—An toàn, an ninh mạng, jailbreak, alignment, giám sátĐã công bố; system card được cập nhậtSystem card được công bố ngày 03/09/2026 và cập nhật ngày 22/09/2026. OpenAI cho biết Astra đạt ngưỡng Critical về năng lực an ninh mạng theo Preparedness Framework; các đánh giá alignment cho thấy mô hình tôn trọng các giới hạn an toàn và bảo mật tốt hơn GPT-5.6 Sol. Tài liệu nêu các giới hạn liên quan đến nhận biết đánh giá và khả năng né giám sát.https://deploymentsafety.openai.com/gpt-6-astra/protocolqa-open-ended
anthropic.claude-fable-5-1-mythos-5-1.safetyĐánh giá an toàn Claude Fable 5.1 và Claude Mythos 5.1Không công bố—An toàn sinh học, an ninh mạng, prompt injection, alignmentĐã công bố; hệ thống card liệt kê tháng 09/2026Anthropic cho biết hai phiên bản dùng cùng mô hình nền nhưng có mức safeguard khác nhau. Các đánh giá trước phát hành gồm red-team chuyên gia và tự động về rủi ro hóa học/sinh học, đánh giá năng lực an ninh mạng, kiểm thử safeguard bên ngoài và đánh giá hành vi alignment. Anthropic báo cáo một số cải thiện so với Mythos 5, đồng thời nêu hạn chế về đánh giá tác vụ rất dài và môi trường nhiều agent.https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system-card
google-deepmind.gemini.stealth-situational-awarenessĐánh giá stealth và nhận biết tình huống của các mô hình Gemini mới nhấtKhông công bố—Năng lực liên quan đến scheming và khả năng né giám sátĐã công bố nghiên cứu và mô tả áp dụng cho các mô hình Gemini mới nhấtGoogle DeepMind mô tả bộ đánh giá năng lực suy luận về nhận biết bối cảnh triển khai và né cơ chế giám sát. Nghiên cứu cho biết các đánh giá này có thể được dùng như một phần của safety case về khả năng scheming và minh họa cách áp dụng với các mô hình Gemini mới nhất; nguồn không nêu tên từng mô hình hay kết quả định lượng trong phần được kiểm tra.https://deepmind.google/research/publications/157938/
mlcommons.ailuminate.google-deepmind.double-blindThử nghiệm đánh giá reliability mù đôi bằng AILuminate trên mô hình Google DeepMindKhông công bố—An toàn và reliability; đánh giá độc lập mù đôiProof of concept đã thực hiện; kết quả định lượng và danh tính mô hình không được công bố trong bài viếtMLCommons cho biết AVERI chạy một tập con dành riêng của prompt AILuminate trên một mô hình Google DeepMind trong môi trường tính toán bảo mật. Theo bài viết, mô hình chưa từng tiếp xúc với tập đánh giá cụ thể này; bài viết mô tả quy trình nhưng không nêu điểm số hoặc tên mô hình.https://mlcommons.org/2026/08/double-blind-reliability-evaluation/
mlcommons.ailuminate.safety-benchmarkAILuminate Safety benchmarkĐa ngôn ngữ; kết quả công khai được nêu cho tiếng Anh và tiếng Pháp—Đánh giá an toàn chatbot genAI theo 12 nhóm nguy cơBenchmark đang được công bố kết quả; trang MLCommons ghi nhận 109 mô hình đã benchmarkMLCommons mô tả AILuminate Safety v1.0 là benchmark cho mô hình chat đa dụng, gồm hơn 24.000 prompt mỗi ngôn ngữ và kết quả công khai cho hệ thống được đánh giá bằng tiếng Anh và tiếng Pháp. Trang benchmark nêu tổng cộng 109 mô hình được benchmark; không xác định được ngày chốt của con số này từ trang đã kiểm tra.https://mlcommons.org/benchmarks/ailuminate/