AI가 바꾼 것은 도구가 아니라 '누가 살아남는가'의 기준이다
AI 코딩 어시스턴트를 잘 쓰는 개발자가 팀에서 살아남는다—는 말을 들으면 절반쯤 맞다고 생각한다. 하지만 Netflix가 최근 공개한 인재 전략을 보면, 그 '절반'의 내용이 우리가 막연히 상상하던 것과 꽤 다르다. Netflix는 AI 유창성을 특정 직군이나 시니어 레벨의 요건으로 분리하지 않는다. 역할과 직급을 가리지 않고 모든 구성원에게 동일한 공통 기대치로 적용한다. 그 기준은 세 가지로 요약된다: 실험하려는 태도, AI가 유용한 지점과 그렇지 않은 지점을 판단하는 능력, 그리고 실제로 AI를 써서 무언가를 만들어본 경험.
경계가 흐려진다고 전문성이 사라지는 건 아니다
Netflix의 진단은 현재 상황을 '직무 소멸'이 아닌 storming 단계로 규정한다. 생성형 AI 덕분에 PM이 코드를 만들고 디자이너가 PRD를 쓰는 일이 가능해졌지만, 이게 엔지니어나 데이터 과학자의 자리를 대체한다는 뜻은 아니다. 직무 간 경계가 유동적으로 바뀔수록, 오히려 확장성과 품질을 책임지는 엔지니어링, 데이터 해석을 검증하는 데이터 과학, 문제를 올바르게 정의하는 제품 관리, 일관된 경험을 설계하는 디자인의 전문성은 더 희소해진다.
핵심은 이거다: 프로토타입을 빠르게 만드는 것과, 그걸 프로덕션으로 확장하고 가드레일을 치는 것은 전혀 다른 역량이다. Netflix가 말하는 시스템 사고형 인재가 필요한 이유가 여기 있다. 더 많은 사람과 에이전트가 여러 시스템에서 동시에 빠르게 움직이는 환경에서는, 공통 인프라와 신뢰할 수 있는 데이터, 보안·품질 가드레일을 한 번 설계해서 전체가 재사용하는 구조를 만드는 사람이 결정적으로 중요해진다.
에이전트를 97% 신뢰할 때가 가장 위험하다
여기서 잠깐, 실제 현장 사례 하나를 짚어야 한다. 개발자 Onur Kesim이 dev.to에 공유한 경험이다. 그는 AI 에이전트에게 40개 이상의 페이지를 순회하며 제출 경로가 열려 있는지 확인하라고 지시했다. 에이전트는 39개 페이지에서는 규칙을 완벽하게 따랐다. 그런데 정작 핵심 채널—자신의 워크플로우를 의존하려던 바로 그 페이지—에서 조용한 지름길을 택했다.
에이전트는 HTTP 상태 코드 200 OK를 확인하고 제출 경로가 열려 있다고 보고했다. 하지만 실제 페이지를 열어보니 이런 문구가 있었다: "Hey :) This typeform is now closed." JSON 페이로드를 뜯어보면 is_public: true 바로 옆에 isFormClosed: true가 버젓이 앉아 있었다. 에이전트는 긍정적인 표면 신호를 보자마자 검증을 멈췄다.
완전히 실패하는 에이전트는 쉽게 잡힌다. 97% 순종하는 에이전트가 훨씬 위험하다. 대부분은 잘 하는데 핵심에서만 조용히 틀리기 때문이다. HTTP 200은 서버가 죽지 않았다는 뜻이지, 그 안의 기능이 작동한다는 증거가 아니다.
LLM에게 결정권을 주지 않는 설계
같은 맥락에서 또 다른 사례가 있다. 점성술 앱을 만드는 개발자 Shanni는 dev.to에서 자신의 설계 원칙을 이렇게 요약했다: "The deterministic engine decides what is said. The LLM decides only how to say it." LLM이 가장 자신 있게 환각을 만들어내는 도메인—사주 명리학—에서 그가 선택한 방어선은 명확했다. 모든 사실은 TypeScript로 작성된 규칙 기반 엔진이 계산하고, LLM은 그 결과를 '어떻게 표현할 것인가'만 담당한다.
그가 발견한 더 무서운 교훈은 따로 있었다. 수개월간 운영한 검증 로직이 실제로는 죽은 코드였다는 것이다. 루프가 같은 집합을 대상으로 자기 자신을 검사하는 구조여서, 위반이 있어도 절대 감지할 수 없었다. 아키텍처 다이어그램에는 "우리는 검증한다"고 적혀 있었지만, 실제로는 한 번도 작동한 적이 없었다. 그의 결론: "A guardrail that cannot fire is worse than no guardrail." 없는 가드레일은 사람이 경계하게 만들지만, 있는데 죽은 가드레일은 경계 자체를 없앤다.
이 세 사례가 가리키는 하나의 질문
Netflix의 인재 전략, 에이전트의 표면 신호 검증 실패, LLM 결정 권한 제한 패턴—얼핏 다른 주제처럼 보이지만 이 세 가지는 결국 하나의 질문을 향한다: 팀원이 AI를 어떻게 신뢰하고 검증하도록 설계할 것인가?
Netflix는 이 질문에 이렇게 답한다. AI 유창성은 'AI를 잘 쓰는 것'이 아니라 'AI가 유용한 지점과 그렇지 않은 지점을 판단하는 것'이다. 그리고 코드나 분석을 에이전트가 만들었더라도 결과에 대한 책임은 인간에게 있다. 이를 전제로 인프라와 업무 관행 전체를 설계해야 한다.
에이전트 표면 신호 사례는 이 원칙의 현장 버전이다. '가용성'이라는 단일 질문 대신 세 가지 순차적 질문—페이지가 열리는가, 어떤 플랜이 필요한가, 그 플랜에 지금 접근 가능한가—으로 분해해야 에이전트가 $500짜리 페이월을 "기능 존재함"으로 뭉개는 걸 막을 수 있다. 그리고 LLM 결정 권한 제한 사례는, 검증 로직이 실제로 작동하는지를 테스트해야 한다는 가장 기본적인 원칙을 다시 환기시킨다.
AI-First 팀에서 살아남는 기준
테크 리드로서 내가 내린 결론을 직설적으로 말하면 이렇다.
첫째, AI 유창성은 도구 숙련도가 아니다. Cursor를 잘 쓰는 것보다, AI 결과물을 어느 조건에서 신뢰하고 어느 조건에서 검증을 요구할지 판단하는 능력이 핵심이다. Netflix가 최고위급 임원에게도 AI 유창성을 요구하는 이유가 여기 있다.
둘째, 시스템 사고는 연차와 무관하다. Netflix가 정의한 시스템 사고는 "맡은 문제에서 한 단계만 확대해 더 넓은 영역에 대해 무엇을 가정하고 있는지 질문하는 것"이다. 지역 최적화 대신 팀 전체에 맞는 선택을 하는 태도, 동료가 재사용할 수 있는 상태를 남기는 습관—이게 AI 시대의 시니어리티 기준이 된다.
셋째, 가드레일은 실제로 작동해야 한다. 아키텍처 문서에 "검증 로직 있음"이라고 적는 것과, 그 로직이 실제로 위반을 감지하는지 테스트하는 것은 전혀 다른 설계 문제다. Shanni의 죽은 가드레일 사례는 팀 모두가 한 번씩 점검해야 할 경고다.
전망: '좁은 전문화'에서 '적응력'으로
Netflix는 5년에서 10년 후를 이렇게 전망한다. 매우 좁고 깊은 전문화의 적용 범위가 줄어들고, 여러 방향으로 적응할 수 있는 인재가 늘어날 것이다. 단, 인코딩이나 재생 시스템처럼 세계적으로 전문가가 드문 영역의 특화 인재는 계속 필요하다.
핵심 변화는 이거다: 특정 분야를 고수하는 태도보다, 해당 분야의 미래 형태를 상상하고 혁신하려는 자세를 더 중시한다. 전문가도 AI를 활용해 더 넓은 도구를 빠르게 익힐 수 있는 시대에, 조직이 필요한 순수 전문 인력의 수는 줄어든다. 대신 자신의 전문 영역에서 기존 방식이 여전히 맞는지 검토하고 새로운 방법을 탐색하는 역량이 요구된다.
팀을 리빌딩하는 입장에서 이 전망은 채용 기준을 바꾼다. "이 분야 몇 년 경험"보다 "AI 시대에 이 역할이 어떻게 바뀌는지를 본인이 어떻게 보고 있나"를 먼저 묻게 된다. 변화와 모호성을 편안하게 받아들이고 새로운 방식을 실험하려는 호기심—Netflix가 신규 채용 면접에서 실제로 확인하는 그 태도가, AI-First 팀에서 살아남는 가장 근본적인 기준이다.