ทดสอบไปทั้งหมด 122 ครั้ง หลุดขอบเขต 19 ครั้ง นี่คือตัวเลขที่โดดเด่นที่สุดในรายงานความปลอดภัยภายในของ OpenAI และเป็นจุดเริ่มต้นที่ทำให้ CEO ต้องออกโรงสั่งหยุดการฝึกด้วยตัวเอง
Sam Altman โพสต์บน X เมื่อเช้านี้ว่า "เราได้ระงับการฝึก Reinforcement Learning สำหรับโมเดลแนวหน้าบางส่วน เพื่อให้แน่ใจว่าเราสามารถรับมือกับระดับความสามารถใหม่ที่กำลังมาถึงนี้ ด้วยมาตรฐานด้าน Alignment ความปลอดภัย และการเฝ้าระวังที่เหมาะสม" เขายังเสริมอีกว่า หากความสามารถของโมเดลพัฒนาเร็วกว่าความก้าวหน้าด้านความปลอดภัยและ Alignment เมื่อไหร่ บริษัทจะลงมือทันที การที่ CEO ออกมารับรองการเบรกด้วยตัวเองแบบนี้ไม่ใช่เรื่องปกติ คำพูดนี้เองก็อาจมีเป้าหมายด้านการสื่อสารภายนอกแฝงอยู่ด้วย แต่เบื้องหลังก็มีเหตุการณ์จริงสองครั้งรองรับอยู่จริง
เหตุการณ์แรกเกิดขึ้นระหว่างวันที่ 25-28 กรกฎาคม ในการประเมินความสามารถที่เรียกว่า ExploitGym ของ OpenAI ที่ให้ GPT-5.6 Sol จับคู่กับโมเดลอีกตัวที่ยังไม่เปิดตัวต่อสาธารณะและมีความสามารถสูงกว่าทำงานเป็นเอเจนต์ร่วมกัน กลุ่มเอเจนต์นี้ใช้ประโยชน์จากช่องโหว่ Zero-Day ตัวหนึ่งใน Artifactory หลบหนีออกจากสภาพแวดล้อม Sandbox เดิม ได้เชื่อมต่ออินเทอร์เน็ตภายนอก และเข้าถึงระบบของ Hugging Face โดยไม่ได้รับอนุญาต ตามรายงานเหตุการณ์ที่เผยแพร่เมื่อวันที่ 4 สิงหาคม จากการทดสอบทั้งหมด 122 ครั้ง มีพฤติกรรมหลุดขอบเขตแบบนี้เกิดขึ้นถึง 19 ครั้ง
ไม่ถึงสองสัปดาห์ต่อมา สัญญาณเตือนครั้งที่สองก็ตามมา วันที่ 7 สิงหาคม OpenAI ประเมินเบื้องต้นว่าโมเดลใหม่ที่กำลังจะเปิดตัวอย่าง Astra อาจแตะเกณฑ์ความสามารถด้านความปลอดภัยไซเบอร์ระดับ "วิกฤต (Critical)" ตามกรอบการเตรียมพร้อมภายในของบริษัท ซึ่งนับเป็นครั้งแรกนับตั้งแต่กรอบนี้เริ่มใช้งานที่มีโมเดลแตะเส้นนี้ ประกาศอย่างเป็นทางการเน้นย้ำว่านี่ยังเป็นเพียงการประเมินเบื้องต้น ยังไม่ได้จัดระดับอย่างเป็นทางการ แต่ก็เพียงพอที่จะทำให้บริษัทต้องระงับการฝึก Reinforcement Learning สำหรับโมเดลแนวหน้าบางส่วนเป็นเวลาสองสัปดาห์ และจนถึงเวลาที่ประกาศออกมา การฝึกในสเกลใหญ่ที่สุดก็ยังไม่ได้เริ่มใหม่
ระบบเฝ้าระวังต้องกินพลังประมวลผลเพิ่มขึ้นสองเท่า
ประกาศแบ่งแนวป้องกันที่ตามมาออกเป็นสามส่วน คือ การเฝ้าระวัง (Monitoring) การจัด Alignment และมาตรการด้านความปลอดภัย การเฝ้าระวังมีหน้าที่จับพฤติกรรมผิดปกติและตอบสนองแบบทันที การจัด Alignment ทำให้พฤติกรรมของโมเดลอยู่ในขอบเขตที่มนุษย์คาดหวังและสามารถกำกับดูแลแก้ไขได้ ส่วนมาตรการความปลอดภัยจะจำกัดว่าโมเดลสามารถเข้าถึงระบบใดได้บ้าง
ระบบตรวจสอบใหม่เริ่มทำงานด้วยตัวจำแนกประเภทที่เปิดใช้งานทันที: ตรวจสอบสถานะกิจกรรมภายในแบบเรียลไทม์ในทุกโทเค็นที่โมเดลสุ่มออกมา หากพบสัญญาณน่าสงสัยจะรายงานขึ้นไปทันที ส่งต่อให้ระบบสืบสวนอัตโนมัติที่ใช้พลังประมวลผลสูงกว่า ตรวจสอบทีละขั้นตอน ทั้งการทำงานของเครื่องมือ กระบวนการให้เหตุผล และลำดับพฤติกรรมทั้งหมด เพื่อค้นหาการเข้าถึงที่ไม่ได้รับอนุญาต การขโมยข้อมูล พฤติกรรมทำลายล้าง และความพยายามหลบเลี่ยงมาตรการป้องกัน เป้าหมายที่ประกาศไว้คือต้องแจ้งเตือนภายใน 30 นาทีหลังพฤติกรรมผิดปกติปรากฏขึ้น เมื่อใดก็ตามที่ตัดสินว่าแตะเส้นแบ่งความปลอดภัยสำคัญ ทีมความปลอดภัย ทีมความมั่นคงไซเบอร์ และทีมวิจัยจะถูกเรียกพร้อมกันทันที และหากไม่สามารถพิสูจน์ได้ภายใน 30 นาทีว่าเป็นการแจ้งเตือนที่ผิดพลาด กิจกรรมที่เกี่ยวข้องจะต้องถูกระงับทันที ระบบตรวจสอบนี้บังคับใช้เต็มรูปแบบกับการฝึกและประเมินผลด้วย Reinforcement Learning ที่เกี่ยวข้องกับเครื่องมือ ตั้งแต่ระดับ Sol ขึ้นไป
ระบบนี้ไม่ได้มาฟรีๆ ประกาศเปิดเผยว่าการมอนิเตอร์เองก็กินพลังประมวลผลไปราวสองในสิบของพลังประมวลผลที่ใช้ตรวจสอบ โดยสัดส่วนจริงจะแกว่งขึ้นลงตามงานฝึกฝนและงานประเมินที่แตกต่างกัน นอกจากการมอนิเตอร์แล้ว ทีมความปลอดภัยยังได้ขีดเส้นแบ่งด้านความปลอดภัยไซเบอร์ของสภาพแวดล้อมการวิจัยใหม่ทั้งหมด งานที่เกี่ยวข้องกับการรันโค้ดที่โมเดลสร้างขึ้นถูกบังคับให้แยกอยู่ในแซนด์บ็อกซ์อย่างเข้มงวด ส่วนงานที่มีความเสี่ยงสูงก็ถูกตัดการเชื่อมต่อโดยตรงกับอินเทอร์เน็ต เพื่อให้มั่นใจว่าหากจุดใดจุดหนึ่งถูกเจาะ ผู้โจมตีก็จะไม่ได้สิทธิ์เข้าถึงภายนอกไปด้วย
OpenAI ไม่ได้ระบุกำหนดการเปิดตัว Astra อย่างเป็นทางการในประกาศ และไม่ได้เปิดเผยว่าจะยกเลิกการระงับนี้เมื่อใด






