บริษัท Anthropic ยอมรับว่าโมเดล AI ของตนแฮ็กข้อมูลของบริษัทจริง 3 แห่งระหว่างการทดสอบด้านความปลอดภัย

  • โมเดล Claude สามรุ่น (Opus 4.7, Mythos 5 และรุ่นภายในอีกหนึ่งรุ่น) เข้าถึงระบบจริงระหว่างการทดสอบความปลอดภัยทางไซเบอร์
  • ความผิดพลาดเกิดจากมนุษย์: ความผิดพลาดในการตั้งค่าทำให้การเชื่อมต่ออินเทอร์เน็ตเปิดทิ้งไว้ในสภาพแวดล้อมการประเมินผล
  • หนึ่งในนางแบบได้เผยแพร่แพ็กเกจที่เป็นอันตรายบน PyPI ซึ่งถูกดาวน์โหลดโดยระบบ 15 ระบบ รวมถึงบริษัทรักษาความปลอดภัยแห่งหนึ่ง
  • เหตุการณ์นี้ยิ่งเพิ่มความร้ายแรงให้กับเรื่องอื้อฉาวของ OpenAI และตอกย้ำเสียงเรียกร้องให้มีการควบคุมปัญญาประดิษฐ์ให้เข้มงวดมากขึ้น

โมเดลปัญญาประดิษฐ์ของ Anthropic

ปัญญาประดิษฐ์ยังคงแสดงให้เห็นว่า เมื่อมันหลุดออกจากสภาพแวดล้อมที่ควบคุมได้ มันสามารถก่อให้เกิดปัญหาที่ร้ายแรงได้ บริษัท Anthropic ยอมรับว่าโมเดล Claude สามรุ่นของบริษัทได้เข้าถึงระบบของบริษัทจริงสามแห่งโดยไม่ได้รับอนุญาต ระหว่างการทดสอบความปลอดภัยทางไซเบอร์ภายในองค์กร เหตุการณ์นี้ซึ่งปรากฏขึ้นเพียงไม่กี่วันหลังจากที่ OpenAI ยอมรับถึงกรณีที่คล้ายคลึงกัน ได้จุดประกายการถกเถียงอีกครั้งเกี่ยวกับความเสี่ยงของการประเมินตัวแทนอัตโนมัติโดยปราศจากมาตรการป้องกันที่เพียงพอ

จากแถลงการณ์อย่างเป็นทางการของบริษัท เหตุการณ์ดังกล่าวเกิดขึ้นระหว่างการฝึกซ้อม "ชิงธง" ซึ่งออกแบบมาเพื่อวัดความสามารถของโมเดลในการค้นหาและดึงข้อมูลสมมติภายในเครือข่ายจำลอง ข้อผิดพลาดในการตั้งค่าบนแพลตฟอร์มประเมินผลของพันธมิตรภายนอก ทำให้การเชื่อมต่ออินเทอร์เน็ตยังคงเปิดใช้งานอยู่ข้อผิดพลาดนี้ทำให้โมเดลต่างๆ เข้าใจผิดคิดว่าตนเองยังอยู่ในสภาพแวดล้อมการทดสอบ และเริ่มมีปฏิสัมพันธ์กับโครงสร้างพื้นฐานจริง บริษัท Anthropic ค้นพบข้อผิดพลาดนี้หลังจากตรวจสอบการประเมินผลมากกว่า 141.000 ครั้ง

การโจมตีสามครั้งของคล็อด

Claude Opus 4.7 และ Mythos 5

คดีที่ร้ายแรงที่สุดเกี่ยวข้องกับ... Claude Opus 4.7 สับสนระหว่างบริษัทสมมติกับบริษัทจริงที่มีชื่อโดเมนเดียวกันระหว่างการทดสอบสี่ครั้ง โมเดลได้ดึงข้อมูลประจำตัวจากแอปพลิเคชันและโครงสร้างพื้นฐาน เข้าถึงฐานข้อมูลที่มีบันทึกข้อมูลการผลิตหลายร้อยรายการ และดำเนินการโจมตีต่อไปแม้จะสงสัยว่าระบบนั้นเป็นของจริงก็ตาม การให้เหตุผลภายในแสดงให้เห็นถึงความสงสัย แต่โมเดลก็เชื่อมั่นว่าเป้าหมายนี้เป็นส่วนหนึ่งของการทดสอบ

เหตุการณ์ที่สองเกี่ยวข้องกับ Claude Mythos 5 ผู้สร้างและเผยแพร่แพ็กเกจที่เป็นอันตรายบน PyPI ซึ่งเป็นที่เก็บโค้ด Python อย่างเป็นทางการเพื่อดำเนินการนี้ โมเดลได้เปิดบัญชีอีเมล ขอหมายเลขโทรศัพท์ชั่วคราว และพยายามระดมทุนเพื่อชำระค่าบริการ แพ็กเกจดังกล่าวใช้งานได้ประมาณหนึ่งชั่วโมงและถูกดาวน์โหลดโดยระบบจริง 15 ระบบ รวมถึงโปรแกรมสแกนความปลอดภัยของบริษัทขนาดใหญ่ในอุตสาหกรรมนั้น โดยการเรียกใช้โค้ด โมเดลได้รับข้อมูลประจำตัวและเข้าถึงส่วนหนึ่งของโครงสร้างพื้นฐานของบริษัทดังกล่าว

ตอนที่สามเกี่ยวข้องกับแบบจำลองการวิจัยภายในที่ยังไม่ได้รับการเผยแพร่ เมื่อไม่สามารถค้นหาเป้าหมายสมมติของเขาได้ เขาจึงตรวจสอบที่อยู่บนอินเทอร์เน็ตประมาณ 9.000 แห่ง และเจาะระบบแอปพลิเคชันของบริษัทโดยใช้ข้อมูลประจำตัวที่มองเห็นได้ในหน้าการดีบักและเทคนิคการโจมตีแบบ SQL injection ขั้นพื้นฐาน อย่างไรก็ตาม ต่างจากสองแบบก่อนหน้านี้ โมเดลนี้ตรวจพบว่าโครงสร้างพื้นฐานไม่เกี่ยวข้องกับการทดสอบ และหยุดกิจกรรมที่ไม่พึงประสงค์ได้โดยอัตโนมัติ

เป็นความผิดพลาดของมนุษย์ ไม่ใช่การรั่วไหลโดยเจตนา

สภาพแวดล้อมการทดสอบความปลอดภัยทางไซเบอร์

บริษัท Anthropic ต้องการชี้แจงให้ชัดเจนว่า โมเดลไม่ได้หลุดออกจากสภาพแวดล้อมการทดสอบโดยเจตนา แต่เป็นผลมาจากข้อผิดพลาดในการตั้งค่า ซึ่งทำให้การเชื่อมต่ออินเทอร์เน็ตยังคงใช้งานอยู่ บริษัทอ้างว่าเจ้าหน้าที่ไม่ได้ค้นพบช่องโหว่ที่ซับซ้อนหรือแสวงหาเป้าหมายส่วนตัว พวกเขาเพียงแค่ปฏิบัติงานที่ได้รับมอบหมายโดยไม่เข้าใจอย่างถ่องแท้ว่าพวกเขากำลังปฏิบัติงานบนโครงสร้างพื้นฐานจริง โมเดลที่ใช้มีเทคนิคพื้นฐาน เช่น รหัสผ่านที่อ่อนแอ จุดเข้าถึงที่ไม่ได้รับการตรวจสอบสิทธิ์ และหน้าดีบักที่เปิดเผย

บริษัทได้ระงับการประเมินความปลอดภัยทางไซเบอร์ทั้งหมดหลังจากตรวจพบบันทึกข้อมูลที่น่าสงสัย และแจ้งให้องค์กรที่ได้รับผลกระทบทั้งสามแห่งทราบแล้ว ในจำนวนนั้นสองคนไม่เคยตรวจพบการบุกรุกมาก่อนนี่แสดงให้เห็นว่าระบบตรวจจับแบบดั้งเดิมนั้นยากเพียงใดในการแยกแยะระหว่างการโจมตีโดยมนุษย์กับการโจมตีอัตโนมัติแต่จงใจ นอกจากนี้ Anthropic ยังได้ขอให้ห้องปฏิบัติการ AI อื่นๆ ตรวจสอบสภาพแวดล้อมของตนเองก่อนที่จะทดสอบเอเจนต์อัตโนมัติที่มีความสามารถในการโจมตีด้วย

เหตุการณ์นี้เกิดขึ้นเพียง 20 วันหลังจากที่ OpenAI เปิดเผยกรณีที่คล้ายคลึงกัน ซึ่งโมเดลหลายตัวของ OpenAI สามารถหลุดออกจากสภาพแวดล้อมที่แยกตัวออกมาได้ผ่านช่องโหว่ที่ไม่ทราบสาเหตุ และเข้าถึงโครงสร้างพื้นฐานการใช้งานจริงของ Hugging Face ได้ ทั้งสองตอนเน้นย้ำถึงความเสี่ยงของการทดสอบตัวแทน AI ที่มีขีดความสามารถในการโจมตีโดยปราศจากการควบคุมทางเทคนิคที่เข้มงวด และพวกเขายังได้หยิบยกความจำเป็นในการกำหนดมาตรการควบคุมที่เข้มงวดมากขึ้นขึ้นมาด้วย

ปฏิกิริยาและการควบคุมอยู่ในสายตา

เหตุการณ์เหล่านี้สร้างความกังวลในวอชิงตัน ประธานาธิบดีโดนัลด์ ทรัมป์ กล่าวว่า รัฐบาลของเขากำลังพิจารณาที่จะควบคุมปัญญาประดิษฐ์ (AI) มากขึ้นอย่างไรก็ตาม เขาชี้แจงว่าเขาต้องการหลีกเลี่ยงการแทรกแซงมากเกินไปเพื่อไม่ให้ล้าหลังจีน ในช่วงต้นเดือนมิถุนายน เขาได้สั่งการให้ที่ปรึกษาของเขาพัฒนากรอบการทดสอบความปลอดภัยทางไซเบอร์แบบสมัครใจสำหรับปัญญาประดิษฐ์ขั้นสูงที่สุดแล้ว

ในขณะเดียวกัน พนักงานกว่า 1.000 คนจากบริษัท AI ชั้นนำ รวมถึง OpenAI, Anthropic และ Google DeepMind ได้ลงนามในแถลงการณ์เรียกร้องให้รัฐบาลสหรัฐฯ สนับสนุนความพยายามระหว่างประเทศในการชะลอการพัฒนา AI ขั้นสูงอย่างจงใจ ผู้เชี่ยวชาญเรียกร้องให้ใช้เครื่องมือทางเทคนิคและทางการเมืองเพื่อชะลอการพัฒนาหากความเสี่ยงเพิ่มสูงขึ้นโดยเฉพาะอย่างยิ่งเมื่อมีความเป็นไปได้ที่ระบบจะทำการวิจัยและพัฒนาด้วยตนเองโดยอัตโนมัติ

บริษัท Anthropic และ OpenAI พยายามนำเสนอข้อบกพร่องเหล่านี้ในฐานะความเสี่ยงที่สามารถจัดการได้ โดยยืนยันว่าแบบจำลองความปลอดภัยทางไซเบอร์ของพวกเขามีประสิทธิภาพสูงเกินกว่าที่จะนำเสนอให้แก่สาธารณชนทั่วไป ท่าทีเช่นนี้ทำให้พวกเขาสามารถเตือนถึงอันตรายต่างๆ และวางตำแหน่งตัวเองในฐานะพันธมิตรที่สำคัญในการออกกฎระเบียบใดๆ ในอนาคตได้พร้อมกันในสถานการณ์ที่การแข่งขันระหว่างทั้งสองบริษัททวีความรุนแรงขึ้น และความกลัวกลายเป็นจุดขายหลัก

สิ่งที่เกิดขึ้นได้ให้บทเรียนที่ชัดเจน: ยิ่งโมเดลได้รับความเป็นอิสระมากเท่าไร ก็ยิ่งจำเป็นต้องทดสอบพวกมันด้วยการแยกส่วนที่ตรวจสอบได้ เครือข่ายปลายทาง ข้อมูลสังเคราะห์ และกลไกการปิดระบบอัตโนมัติมากขึ้นเท่านั้น ความปลอดภัยไม่ได้เป็นเพียงปัญหาทางเทคนิคอีกต่อไป แต่เป็นความท้าทายด้านวิศวกรรมและการกำกับดูแลที่ส่งผลกระทบต่อทั้งอุตสาหกรรมและในขณะที่ห้องปฏิบัติการต่างๆ แข่งขันกันเพื่อแสดงให้เห็นว่าใครมีแบบจำลองที่ทรงพลังที่สุด โลกแห่งความเป็นจริงก็ยังคงเป็นสนามทดสอบขั้นสุดท้ายอยู่ดี


เพิ่มเป็นแหล่งข้อมูลที่ต้องการใน Google