AI 모델을 선택할 때 가장 먼저 확인해야 하는 자료가 바로 모델 카드(Model Card)예요. 특히 Anthropic이 차세대 모델 Mythos를 위해 준비한 프리뷰 카드는 기존의 간단한 스펙 시트를 훨씬 넘어서는 수준의 정보를 담고 있어요. 기술 역량부터 윤리적 판단 기준, 위험 완화 전략까지 한 문서에서 모두 확인할 수 있도록 설계되어 있어요.
이번 글에서는 Mythos Preview Card를 처음 접하는 분들이 꼭 알아야 할 핵심 내용을 섹션별로 친절하게 설명할게요. 어떤 항목이 어디에 있는지, 그 수치가 실제로 무엇을 의미하는지까지 구체적으로 짚어드릴게요.
모델 카드가 생겨난 배경
모델 카드는 2019년 구글 연구팀이 처음 제안한 개념이에요. AI 모델이 사회에 미치는 영향이 커지면서, 모델을 배포할 때 성능 정보뿐 아니라 잠재적 위험과 편향도 함께 공개해야 한다는 논의에서 비롯됐어요. 이후 Anthropic, OpenAI, Google DeepMind 등 주요 AI 기업들이 모두 이 관행을 채택하기 시작했어요.
Anthropic의 모델 카드는 특히 안전성(Safety)에 대한 서술이 매우 상세해요. 단순히 “이 모델은 안전합니다”라고 선언하는 게 아니라, 어떤 방법으로 테스트했는지, 어떤 결과가 나왔는지, 그리고 여전히 남아있는 위험은 무엇인지를 구체적으로 기술해요. 이런 투명성이 연구 커뮤니티에서 Anthropic을 신뢰하는 이유 중 하나예요.
- 2019: 구글이 모델 카드 개념 최초 제안
- 2021: Anthropic 설립 후 자체 모델 카드 체계 구축
- 2023: Claude 2 모델 카드 — 안전성 평가 섹션 대폭 강화
- 2026: Mythos Preview Card — 자율 에이전트 위험 평가 포함
Mythos Preview Card의 전체 구조
Anthropic Mythos Preview Card는 총 다섯 개의 주요 파트로 구성돼 있어요. 각 파트는 서로 연결되어 있지만, 필요한 부분만 골라서 읽어도 충분한 정보를 얻을 수 있어요.
첫 번째 파트인 모델 개요(Model Summary)는 일반 독자용으로 작성돼 있어요. 기술 배경 없이도 이해할 수 있는 수준의 설명으로, Mythos가 무엇을 할 수 있고 어떤 상황에 적합한지 간략하게 소개해요. 두 번째 파트 학습 접근법(Training Approach)에서는 어떤 데이터로 훈련됐는지, Constitutional AI 방법론이 어떻게 적용됐는지를 설명해요.
- Part 1: 모델 개요 — 목적, 적합 사용자, 주요 특징
- Part 2: 학습 방법론 — 데이터 출처, CAI 적용 방식
- Part 3: 능력 평가 — 분야별 벤치마크 결과
- Part 4: 안전성 평가 — 레드팀 결과, 위험 등급
- Part 5: 사용 가이드 — 권장 용도, 금지 용도
능력 평가 섹션 읽는 법
Preview Card에서 능력 평가 섹션은 숫자가 가장 많이 등장하는 부분이에요. 처음 보면 복잡해 보이지만, 몇 가지 핵심 벤치마크의 의미만 알아두면 전체 그림이 금방 잡혀요.
벤치마크 결과를 읽을 때 주의해야 할 점이 있어요. 같은 벤치마크라도 평가 방법이나 샷(shot) 수에 따라 점수가 달라져요. 예를 들어 0-shot(힌트 없이 바로 답)과 5-shot(예시 5개를 보고 답)은 같은 테스트라도 결과 차이가 날 수 있어요. 그래서 Preview Card에서는 평가 조건을 항상 명시해줘요.
또한 벤치마크 포화 현상(benchmark saturation)도 고려해야 해요. 일부 벤치마크는 최신 모델들이 인간 전문가 수준을 넘어서면서 더 이상 차별화가 어려워졌어요. Mythos Preview Card가 GPQA Diamond나 FrontierMath 같은 더 어려운 벤치마크를 함께 제시하는 것도 이런 이유예요.
- 0-shot vs few-shot: 힌트 없이 vs 예시를 보고 답하는 방식 구분 확인
- 인간 기준선: 전문가·비전문가 인간 점수와 비교하는 행 참고
- 신뢰 구간: ±로 표기된 오차 범위 — 작을수록 결과가 안정적
- 이전 모델 비교: Claude 3.5 Sonnet 대비 개선 폭 확인
안전성 등급 체계 이해하기
Mythos Preview Card에서 가장 독특한 부분이 바로 안전성 등급(Safety Level) 체계예요. Anthropic은 AI Safety Level(ASL)이라는 자체 기준을 만들어서 모델의 위험 수준을 단계별로 평가해요.
ASL-1은 일반 소프트웨어 수준의 위험, ASL-2는 현재 Claude 모델들이 해당하는 낮은 위험 수준이에요. ASL-3는 생물 무기나 사이버 공격에 대한 의미 있는 도움을 줄 수 있는 수준을 의미하고, ASL-4 이상은 자율적인 위험 행동이 가능한 수준이에요. Mythos Preview Card에는 이 등급에 따른 현재 평가 결과와 향후 안전 조치가 함께 기술돼 있어요.
- ASL-1: 일반 소프트웨어와 동등한 수준의 위험
- ASL-2: 제한적 위험 — 현 Claude 3.x 수준
- ASL-3: 전문 지식 없는 사용자도 대량 피해 무기 제작 가능 수준
- ASL-4: 자율 행동으로 전략적 위험 초래 가능 수준
Mythos가 어느 ASL 등급으로 평가됐는지는 Preview Card의 핵심 내용 중 하나예요. 만약 ASL-3 이상으로 평가된다면, Anthropic은 추가 안전 장치 없이는 배포하지 않는다는 원칙을 갖고 있어요.
레드팀 결과 섹션의 의미
Preview Card에는 레드팀(Red Team) 평가 결과도 포함돼 있어요. 레드팀이란 모델을 공격적으로 테스트하는 전담 팀이에요. 일반 사용자가 아니라 악의적 행위자의 입장에서 모델의 취약점을 찾아내는 역할을 해요.
레드팀 결과에서 주목해야 할 지표는 성공 공격 비율(Attack Success Rate)이에요. 예를 들어 “1,000번의 탈옥 시도 중 몇 번이나 모델이 유해한 내용을 출력했는가”를 보는 거예요. 이 수치가 낮을수록 모델의 안전 장치가 견고하다는 의미예요. Anthropic은 이 결과를 숨기지 않고 Preview Card에 그대로 공개하는 것으로 유명해요.
- 탈옥 저항성: 다양한 프롬프트 공격에 대한 방어 성공률
- jailbreak 유형별 분류: 역할극, 코드 인젝션, 다중 언어 우회 등
- 전문가 레드팀 vs 자동화 공격: 두 방식 모두 포함
- 발견된 취약점 분류: 심각도 별 집계 및 패치 여부
사용 가이드와 금지 사항
Preview Card의 마지막 파트는 실제 사용자에게 가장 실용적인 섹션이에요. Mythos를 어떤 용도에 사용해도 좋은지, 반대로 절대 사용해서는 안 되는 경우가 무엇인지를 명확하게 안내해요.
권장 사용 사례로는 연구 보조, 교육 자료 제작, 소프트웨어 개발 지원, 문서 분석 및 요약 등이 포함돼요. 특히 Mythos는 긴 컨텍스트 창(Long Context Window)이 강점이기 때문에, 대용량 문서 처리나 복잡한 멀티스텝 프로젝트에 특히 유용하다고 명시돼 있어요.
- 권장: 학술 연구, 코드 리뷰, 비즈니스 문서 분석
- 조건부 허용: 의료·법률 정보 제공 (전문가 검토 병행 조건)
- 제한적 허용: 취약 계층 대상 서비스 (추가 안전장치 필요)
- 금지: 무기 개발, 사기, 개인 식별 정보 수집·악용
결론 — Preview Card를 제대로 활용하는 법
Anthropic Mythos Preview Card는 단순한 스펙 문서가 아니라 이 모델을 책임감 있게 사용하기 위한 종합 안내서예요. 숫자로 된 벤치마크만 보는 게 아니라, 안전성 등급과 레드팀 결과, 그리고 사용 가이드라인을 함께 읽어야 전체 그림이 완성돼요.
특히 기업에서 Mythos를 도입하려는 분들이라면, 사용 사례가 금지 또는 제한 영역에 해당하는지 먼저 확인하는 게 중요해요. Preview Card에 담긴 정보는 Anthropic과 사용자 모두에게 책임 있는 AI 활용을 위한 공동의 약속이에요. 이 문서를 꼼꼼히 읽는 것 자체가 AI를 올바르게 사용하는 첫걸음이에요.