오픈웨이트 AI 모델이 최첨단 기술을 따라잡고 있다. 안전성 격차는 남아있다.

1년 전만 해도 폐쇄형 최첨단 모델과 오픈웨이트 모델 간의 격차는 극복 불가능해 보였습니다. 오늘날 그 격차는 대부분의 연구자들이 예상한 것보다 빠르게 좁혀지고 있으며, 오픈웨이트 AI 모델은 벤치마크 후 벤치마크에서 최첨단 기술을 따라잡고 있습니다.

Share

오픈웨이트 AI 모델이 최첨단 기술을 따라잡고 있다. 안전성 격차는 남아있다.

1년 전만 해도 폐쇄형 최첨단 모델과 오픈웨이트 모델 간의 격차는 극복 불가능해 보였습니다. 오늘날 그 격차는 대부분의 연구자들이 예상한 것보다 빠르게 좁혀지고 있으며, 오픈웨이트 AI 모델은 벤치마크 후 벤치마크에서 최첨단 기술을 따라잡고 있습니다. 하지만 기능 동등성이 가까워질수록 더 어려운 질문이 떠오릅니다. 안전성도 함께 발전하고 있을까요?

무엇이 일어났는가

오픈웨이트 모델의 궤적이 극적으로 변했습니다. 폐쇄형 모델을 좁은 코딩이나 추론 벤치마크에서 따라잡으려던 경쟁에서 시작된 것이 더 광범위한 것으로 진화했습니다. 미국, 유럽, 중국의 연구 기관과 기술 회사들의 최근 출시 사례들은 오픈웨이트 모델이 이제 명령어 따르기, 다단계 추론, 심지어 한때 가장 비싼 독점 시스템의 전유물이었던 특정 창의적 작업에서도 경쟁할 수 있음을 보여주었습니다.

패턴은 일관되고 잘 문서화되어 있습니다. 최첨단 연구소가 폐쇄형 모델을 출시하고 새로운 기능 한계를 설정하면, 몇 개월 내에 — 때로는 몇 주 내에 — 유사한 아키텍처와 기법으로 훈련된 오픈웨이트 모델이 대부분의 거리를 좁힙니다. 그 후 커뮤니티는 그 모델을 미세 조정하고, 양자화하고, 연구 클러스터에서 소비자 노트북까지 모든 곳에 배포합니다.

발전하지 못한 것은 안전 인프라입니다. 폐쇄형 모델은 광범위한 레드팀 작업, 헌법적 AI 기법, 해로움 회피를 위해 특별히 조정된 인간 피드백으로부터의 강화 학습, 그리고 지속적인 모니터링 파이프라인과 함께 출시됩니다. 오픈웨이트 모델은 그 성질상 이러한 보안 장치 없이 출시됩니다. 가중치가 제품입니다. 그것으로 무엇을 하는지, 그리고 얼마나 안전하게 배포하는지는 전적으로 운영자에게 달려 있습니다.

이것은 오픈웨이트 개발에 대한 비판이 아닙니다. 이것은 구조적 현실입니다. 모델 가중치를 공개적으로 출시하면 다운스트림에서 발생하는 미세 조정을 제어할 수 없습니다. 연구자들은 오픈웨이트 모델에 적용된 안전 미세 조정이 상대적으로 적당한 계산량과 적은 양의 적대적 예제 데이터셋으로 제거될 수 있음을 반복적으로 보여주었습니다. 기능은 있습니다. 안전 계층은 선택 사항이므로 취약합니다.

결과는 가장 기능이 뛰어난 오픈 모델이 정말 인상적이면서도 — 유사한 기능 수준의 폐쇄형 모델보다 부주의하게 배포할 경우 정말 더 위험한 — 환경입니다.

아시아에 중요한 이유

이 이야기에서 아시아의 위치는 주변적이지 않습니다. 현재 유통 중인 가장 기능이 뛰어난 오픈웨이트 모델 중 일부는 중국 기술 회사와 연구 기관에서 나왔습니다. 동남아시아, 인도, 일본, 한국 전역의 개발자들은 이러한 모델을 가장 활발하게 미세 조정하고 배포하는 사람들 중 하나이며, 수억 명의 사용자에게 서비스하는 제품을 구축하고 있습니다.

이것이 지역에 특정한 여러 가지 이유로 중요합니다. 첫째, 아시아의 규제 체계는 단편화되어 있습니다. EU AI 법은 유럽 배포에 대해 상대적으로 통일된 (비록 불완전하지만) 기준을 수립합니다. 아시아는 이에 해당하는 것이 없습니다. 싱가포르의 개발자들은 인도네시아, 베트남, 일본의 개발자들과 다른 기대치 하에서 운영됩니다. 이러한 단편화는 오픈웨이트 모델의 안전 격차가 당신이 구축하는 위치에 따라 다르게 나타난다는 것을 의미하며, 가장 위험한 배포를 막을 공통의 기준이 없습니다.

둘째, 아시아의 개발자 생태계는 기초 연구보다는 실제 배포에 불균형적으로 집중되어 있습니다. 지역의 대부분의 창업자와 엔지니어들이 묻는 질문은 "더 안전한 모델을 어떻게 훈련할 것인가?"가 아니라 "최고의 사용 가능한 모델을 사용하여 더 빠르게 출시하려면 어떻게 해야 할까?"입니다. 오픈웨이트 모델은 이 사용 사례에 매우 매력적입니다. API 비용이 없고, 속도 제한이 없으며, 스택에 대한 완전한 제어, 그리고 제3자 서버로 보내지 않고 독점 데이터에 대해 미세 조정할 수 있는 능력입니다.

이것들은 실제 장점입니다. 하지만 아시아 기술 생태계가 이제 막 진지하게 다루기 시작한 실제 책임을 동반합니다. 자카르타나 호찌민시의 스타트업이 소비자 대면 제품에 미세 조정된 오픈웨이트 모델을 배포할 때, 그 배포의 안전 특성은 전적으로 그들에게 달려 있습니다. 최첨단 연구소의 안전 팀이 그들의 미세 조정과 사용자 사이에 서 있지 않습니다.

셋째, 언어와 문화적 맥락이 문제를 악화시킵니다. 오픈웨이트 모델에 대한 대부분의 안전 연구와 레드팀 작업은 영어로 수행됩니다. 영어 적대적 프롬프트에서 합리적으로 작동하는 동일한 모델이 바하사 인도네시아, 태국어, 베트남어로 프롬프트될 때 — 안전 미세 조정 데이터가 부족하고 엄격한 평가가 더 어려운 언어 — 매우 다르게 작동할 수 있습니다.

개발자에게 의미하는 바

로컬에서 추론을 실행하든, 클라우드 인프라에 배포하든, 특정 도메인을 위해 미세 조정하든 오픈웨이트 모델 위에서 구축하는 개발자라면, 안전 격차는 다른 누군가의 문제가 아니라 당신의 문제를 해결해야 합니다. 이것은 폐쇄형 모델 패러다임에서 상당한 변화이며, 스택에 대해 어떻게 생각하는지에 대한 다른 정신 모델이 필요합니다.

구체적으로 내재화할 가치가 있는 몇 가지가 있습니다.

안전 미세 조정은 일회성 단계가 아닙니다. RLHF 또는 헌법적 AI 기법을 오픈웨이트 기본 모델에 적용하면, 기능을 위해 계속 미세 조정할 때 이러한 특성이 저하될 수 있습니다. 작업 성능을 최적화하는 모든 훈련 실행은 정렬 특성을 침식할 수 있습니다. 초기 배포 시점뿐만 아니라 안전 특성을 지속적으로 테스트하는 평가 파이프라인이 필요합니다.

시스템 프롬프트는 안전 계층이 아닙니다. 시스템 프롬프트를 통해 모델에 "해로운 주제를 절대 논의하지 마"라고 지시하는 것은 보안 장치가 아니라 속도 범프입니다. 적당한 프롬프트 엔지니어링 기술을 가진 적대적 사용자는 시스템 프롬프트 기반 제한을 우회할 수 있습니다. 당신의 애플리케이션이 의미 있는 안전 요구 사항을 가지고 있다면, 출력 필터링, 속도 제한, 행동 모니터링을 포함한 여러 계층에서 시행되어야 합니다.

기능-안전 격차는 모델 크기에 따라 확대됩니다. 소비자 하드웨어에서 효율적으로 실행되는 더 작은 양자화 모델은 일반적으로 전체 정밀도 대응 모델보다 더 쉽게 탈옥될 수 있습니다. 왜냐하면 안전 미세 조정이 더 낮은 매개변수 개수에서 더 취약하기 때문입니다. 추론 비용을 줄이기 위해 양자화 모델을 배포하는 경우, 이를 위협 모델에 포함시키십시오.

대상 언어에서의 평가는 필수입니다. 사용자가 주로 영어 이외의 언어로 제품과 상호 작용하는 경우, 안전 평가는 해당 언어로 수행되어야 합니다. 영어 레드팀 작업 결과는 안정적으로 전이되지 않습니다. 이것은 더 광범위한 오픈 소스 커뮤니티가 상당한 맹점을 가지고 있는 영역이며, 아시아 시장을 위해 구축하는 개발자들이 자신의 노력을 투자해야 하는 영역입니다.

MonstarX — 아시아의 AI 네이티브 개발 플랫폼 — 위에서 구축하는 팀의 경우, 이러한 고려 사항은 프로덕션 배포가 구조화되는 방식에 점점 더 중심이 되고 있습니다. 플랫폼의 커넥터는 모델 출력을 최종 사용자에게 도달하기 전에 외부 안전 분류기 또는 콘텐츠 조정 API를 통해 라우팅하는 것을 간단하게 만들어주며, 이는 개발자에게 전체 스택을 재구축하지 않고도 오픈웨이트 배포 위에 안전 계층을 추가할 수 있는 실용적인 메커니즘을 제공합니다.

더 광범위한 요점은 오픈웨이트 모델이 동시에 힘과 책임을 제공한다는 것입니다. 이러한 모델 위에서 가장 지속 가능한 제품을 구축할 개발자들은 안전 인프라를 일류 엔지니어링 관심사로 취급하는 사람들입니다. — 사후 생각이 아니며, 모델 제공자가 해결하기를 기다리는 것도 아닙니다.

핵심 요점

오픈웨이트의 수렴