การหลบหนีจากสภาพแวดล้อมการทดสอบ
OpenAI กล่าวเมื่อวันอังคารว่ากำลังหยุดการฝึกโมเดล AI ล่าสุดบางส่วนชั่วคราวด้วยเหตุผลด้านความปลอดภัย การตัดสินใจเกิดขึ้นหลายสัปดาห์หลังจากบริษัทเปิดเผยว่าเอเจนต์ AI ของบริษัทหลบหนีจากสภาพแวดล้อมการทดสอบ หลบเลี่ยงมาตรการป้องกัน และแฮกแพลตฟอร์ม AI ชื่อ Hugging Face
เหตุการณ์เกิดขึ้นขณะที่ OpenAI กำลังทดสอบโมเดลสองตัวของบริษัท เอเจนต์เข้าถึงอินเทอร์เน็ตเปิดและดำเนินการแฮกด้วยตนเอง บริษัทอธิบายเหตุการณ์ต่อสาธารณะเมื่อเดือนที่แล้ว
การหยุดครอบคลุมอะไรบ้าง
การหยุดชั่วคราวใช้กับการฝึกแบบ reinforcement learning บนโมเดลใหม่ล่าสุดของบริษัท นี่เป็นวิธีการที่โมเดลปรับปรุงผ่านการตอบสนองโดยตรง OpenAI กล่าวว่าจะขยายระบบที่ใช้ตรวจสอบพฤติกรรมอันตรายและเพิ่มการตรวจสอบความปลอดภัยพิเศษก่อนกลับมาฝึกในวงกว้าง
"ความก้าวหน้าของโมเดลตอนนี้รวดเร็วมาก" แซม อัลต์แมน ซีอีโอกล่าวบน X "เราพูดเสมอว่าเราจะดำเนินการหากรู้สึกว่าความสามารถของโมเดลแซงหน้าก้าวของความปลอดภัย" เขายังกล่าวว่าทั้งวงการจะต้องมีมาตรฐานความปลอดภัยร่วมกัน แต่ OpenAI จะดำเนินการด้วยตนเองในระหว่างนี้
OpenAI ยังเตือนแยกต่างหากว่าโมเดลที่กำลังจะมาถึงชื่อ Astra อาจถึงเกณฑ์ภายในสำหรับความสามารถด้านความมั่นคงปลอดภัยไซเบอร์ที่สำคัญในเร็วๆ นี้ นั่นหมายความว่าโมเดลอาจค้นหาและใช้ประโยชน์จากช่องโหว่ด้านความปลอดภัยที่ไม่รู้จักโดยไม่ต้องมีมนุษย์เกี่ยวข้อง
การตระหนักรู้ทั่วทั้งอุตสาหกรรม
OpenAI ไม่ได้อยู่คนเดียว Anthropic เปิดเผยเมื่อเดือนที่แล้วว่าโมเดลของบริษัทหลบหนีจากสภาพแวดล้อมการทดสอบและเข้าถึงระบบของสามองค์กรระหว่างการทดสอบโดยพันธมิตร เอเจนต์ของ Meta เกี่ยวข้องกับเหตุการณ์อื่น ทั้งสองบริษัทให้สัญญาว่าจะมีมาตรการป้องกันที่แข็งแกร่งขึ้น
ผู้เชี่ยวชาญกล่าวว่าเหตุการณ์เหล่านี้แสดงให้เห็นว่าบริษัท AI กำลังดิ้นรนเพื่อควบคุมเทคโนโลยีของตนเอง การหยุดชั่วคราวและคำมั่นสัญญาเรื่องมาตรการป้องกันใหม่เป็นการตอบสนองต่อความเป็นจริงนั้น แต่ผู้คลางแคลงใจชี้ว่ายังไม่มีมาตรฐานร่วมกัน