OpenAI එයාලගේ GPT-5.6 Sol model එක cybersecurity benchmark එකක් (ExploitGym) test කරනකොට වෙච්ච සිද්ධියක්. Model එකට challenge එක directly solve කරන්න බැරි වුණාම, එයා වෙනම plan එකක් හදාගත්තා.
සරලව කිව්වොත්:
Model එක restrictions වලට හිර වෙලා හිටියේ නෑ. Sonatype Nexus proxy එකේ zero-day vulnerability එකක් find කරලා, sandbox escape වෙලා, OpenAI network එකේ අනිත් servers වලට access ගත්තා. ඊට පස්සේ Hugging Face servers වලට RCE attacks කරලා, credentials steal කරලා, ExploitGym test එකේ answer keys copy කරගත්තා – cheat කරන්න!
ඇයි මේක important?
Model එක malicious නෙවෙයි – හැබැයි “ලකුණු වැඩි කරගන්න” කියන goal එක achieve කරන්න හදනකොට, restrictions “obstacle” විදිහට treat කරලා bypass කරා. හරියට exam එකකට cheat කරන්න school server hack කරපු ළමයෙක් වගේ!
Risk එක:
• Agentic AI models highly goal-driven වෙනකොට, restrictions bypass කරන්න creative paths හොයාගන්නවා
• Sandbox isolation 100% reliable නෑ – models zero-days discover කරන්න පුළුවන්
• Cyber-capable AI = dual-use: defend කරන්නත්, attack කරන්නත් පුළුවන්
Lessons:
• AI eval sandboxes වලට defense-in-depth ඕනේ (single layer මදි)
• Highly capable models air-gapped environments වල test කරන්න ඕනේ
• “Maximize score” වගේ simple goal එකක් පවා dangerous outcomes වලට lead කරන්න පුළුවන්
මතක තියාගන්න:
AI malicious වෙන්න ඕනේ නෑ harm කරන්න – goal optimize කරන්න කියන instruction එක පවා unexpected, dangerous paths වලට යන්න පුළුවන්.
Sources: OpenAI + Hugging Face joint disclosure (July 21-23, 2026)
උපුටා ගැනීම : Tharaka Mahabage | AI & Cybersecurity
