Expanded Korean analysis · 2026-08-29

코드를 만드는 능력에서
시스템을 판단하는 능력으로

Andrew Ng의 AI Engineering Skills Map 1~3편을 시간순으로 복원하고, 원문에서 이름만 언급된 eval·RAG·agent harness·MCP·observability·보안·데이터 아키텍처를 공식 자료로 보완한 확장 해설입니다.

3 posts verified4 top-level pillars11 detailed subskills10,000+ job postings claimed2 pillars still forthcoming
Verification

찾은 글이 맞는가

맞습니다. 첫 글은 4대 역량을 선언한 전체 지도, 둘째 글은 첫 번째 축인 ‘AI 애플리케이션 구축·배포’를 6개로 확장한 글, 셋째 글은 두 번째 축인 ‘소프트웨어 엔지니어링 기본기’를 5개로 확장한 글입니다. 공식 글 목록에는 각각 2026년 8월 14일·21일·28일로 기록되어 있고, 3편 X 게시물은 한국 시간 8월 29일에 노출됐습니다.
4AI Engineering 상위 역량
6AI 앱 구축·배포 하위 역량
5소프트웨어 기본기 하위 영역
2아직 상세편이 나오지 않은 축
읽을 때 주의: 이것은 직무명 ‘AI Engineer’를 위한 전용 커리큘럼이 아닙니다. Andrew Ng은 full-stack·data·DevOps·ML 개발자 모두에게 필요한 공통 역량을 설명합니다. 또한 공개된 방법론은 대규모 자료를 사용했다는 설명이지 재현 가능한 연구 보고서는 아닙니다.
Series timeline

세 편은 논지를 어떻게 확장했나

버튼을 눌러 각 글의 핵심 주장과 지도 항목을 비교할 수 있습니다.

핵심 질문

AI가 소프트웨어 제작 방식을 바꾼 지금, 개발자는 무엇을 배워야 하는가?

대답

AI 앱, SW 기본기, 코딩 에이전트, shaping the build의 네 축과 지속 학습.

가치 이동

직접 구현만 하는 역할에서 측정·지휘·제품 판단·ownership으로 이동.

Building & deploying AI applications

불확실한 출력을 측정·통제해 신뢰할 수 있는 제품으로 만든다.

Software engineering fundamentals

성능·비용·신뢰성·보안 trade-off를 이해해 에이전트를 지휘한다.

Using coding agents

컨텍스트, 계획, 검증기, 멀티에이전트와 권한을 운용한다.

Shaping the build

명세를 받는 사람이 아니라 고객·사업 맥락으로 무엇을 만들지 결정한다.

핵심 명제: AI 애플리케이션은 출력이 예측 불가능하기 때문에 전통 소프트웨어보다 개발 경로를 미리 고정하기 어렵습니다. 뛰어난 엔지니어는 중간 출력을 보고 다음 시도를 정확히 고르는 능력으로 불확실한 부품에서 신뢰할 수 있는 시스템을 만듭니다.

LLM foundations

모델의 생성·컨텍스트·sampling·tool calling·fine-tuning 경계.

Grounding with data

prompt와 retrieval, vector·graph·semantic layer, 신선한 데이터.

Agentic systems

workflow와 harness, 도구·메모리·context·multi-agent·guardrail.

Evaluation-driven development

trace와 오류 분석, deterministic·judge·human eval의 반복 루프.

Operating in production

관측, drift, 보안 사고, 통계적 regression, 비용·latency 최적화.

ML foundations

bias/variance, error analysis, 데이터 엔지니어링과 모델 trade-off.

핵심 명제: 에이전트가 코드를 전부 쓸 수 있어도 trade-off가 존재한다는 사실과 그 결과를 모르면 올바른 지시를 내릴 수 없습니다. 문법 암기의 가치는 줄지만 시스템 이해의 가치는 오릅니다.

Full-stack applications

UI·rendering·API·auth·state·async·persistence·test·accessibility.

Managing data

access pattern·저장 모델·transaction·품질·privacy·lifecycle.

System architecture

경계·분해·state·stack·monolith/microservice·단계별 진화.

Secure & reliable systems

테스트 전략·degradation·blast radius·shift-left security.

Scale & production

SDLC·CI/CD·IaaS·observability·incident·load·technical debt.

Integrated map

현재까지 공개된 통합 스킬맵

첫 글의 네 축 위에 2·3편에서 공개된 11개 하위 역량을 붙였습니다. 점선 축은 아직 상세편이 나오지 않았음을 뜻합니다.

상세편 공개 완료첫 글의 개요만 공개
Central thesis

세 편을 관통하는 한 가지 변화

구현 비용이 낮아질수록 판단·검증·아키텍처·제품 방향의 가치가 올라갑니다. AI가 코드 생성량을 늘리지만, 무엇을 만들지·어떻게 나눌지·어떤 실패를 측정할지·언제 출시할지는 자동으로 해결하지 않습니다.

AI 엔지니어링의 실제 피드백 루프

1. Shape문제·사용자·성공조건
2. Architect데이터·경계·권한
3. Build에이전트가 구현 가속
4. Observetrace·출력·사용자 행동
5. Evaluate오류 분류·regression
6. Decide다음 실험·중단·확장

상대적으로 가치가 줄어드는 것

  • 문법과 API 이름의 단순 암기
  • boilerplate와 반복 코드 생산
  • 정해진 화면의 기계적 구현
  • 한 도구·framework 사용법만 아는 것
  • 검증 없이 “컴파일된다”를 완료로 보는 태도

가치가 커지는 것

  • 명세·인터페이스·시스템 경계 설계
  • 평가 데이터와 verifier 만들기
  • 데이터·보안·신뢰성 trade-off
  • AI 생성 코드를 빠르게 읽고 검토하기
  • 제품 판단과 다음 실험 선택
Part 2 deep dive

AI 앱 구축·배포: 여섯 역량을 실제 업무로 번역

MODEL

1. LLM foundations

모델을 호출하는 법이 아니라 실패 경계를 예측하는 지식입니다.

  • tokenization과 context budget
  • cache·knowledge cutoff·sampling
  • reasoning effort와 tool calling
  • 모델 조합, fine-tune, self-host 판단

산출물: 모델 선택표와 실패 예상 목록.

CONTEXT

2. Grounding with data

정답을 모델 파라미터에 기대지 않고 외부 지식과 연결합니다.

  • prompt 포함 vs on-demand retrieval
  • vector index·knowledge graph·semantic layer
  • 문서 parsing과 chunking
  • freshness·권한·provenance

산출물: 질문 유형별 retrieval 전략과 근거 표시.

AGENT

3. Agentic systems

예측 가능한 workflow와 유연한 agent loop 사이에서 복잡성을 선택합니다.

  • chain·route·parallel·orchestrate
  • tool/MCP/CLI/sandbox
  • memory·context compaction
  • stop condition·human approval

산출물: 권한표, 상태 전이, 실패·중단 조건.

EVAL

4. Evaluation-driven dev

성공 기준을 사례와 측정으로 바꾸고 매 변경마다 비교합니다.

  • trace와 output sampling
  • 오류 taxonomy와 slice
  • deterministic·judge·human eval
  • eval 자체의 신뢰도 확인

산출물: 버전 관리되는 eval set과 오류 대시보드.

OPS

5. Operating in production

실사용 환경에서 품질·비용·지연·보안을 함께 관찰합니다.

  • latency·error·traffic·saturation
  • AI 품질·groundedness·drift
  • incident와 rollback
  • 모델·workflow 비용 최적화

산출물: SLI/SLO, alert, incident playbook.

ML

6. ML foundations

불확실한 출력의 원인을 데이터·모델·평가로 분해하는 사고 도구입니다.

  • bias/variance와 generalization
  • train/eval data mismatch
  • precision/recall과 threshold
  • 학습·추론 비용 trade-off

산출물: 오류 원인 가설과 다음 데이터 실험.

Part 3 deep dive

소프트웨어 기본기: 에이전트에게 무엇을 지시해야 하는가

영역알아야 하는 것모르면 에이전트가 하기 쉬운 실수검증할 증거
Full-stackrendering, caching, API, auth, state/session, async, persistence, testing, accessibility인증을 UI에만 두거나, 캐시 invalidation·상태 경계를 잘못 설계사용자 흐름 E2E, API contract, authz test, 접근성 검사
Dataaccess pattern, storage model, transaction, concurrency, quality, privacy, lifecycle현재 CRUD에는 맞지만 미래 migration과 AI context를 망치는 schema 선택schema·retention·lineage·migration plan·freshness SLO
Architecture경계, 분해, state placement, stack, prototype/production/scale 단계단순 앱을 불필요한 microservice로 쪼개거나 load·cost 요구를 무시quality attribute, ADR, 부하 실험, failure model
Security & reliabilitytest strategy, degradation, blast radius, least privilege, supply chainLLM 출력이나 외부 문서를 신뢰하고 권한 있는 도구로 전달threat model, dependency scan, chaos/failure test, approval gate
Productionrelease, CI/CD, IaaS, observability, incident, scaling, technical debtdemo가 된 것을 운영 가능하다고 착각하고 rollback·alert·capacity를 누락SLI/SLO, dashboard, runbook, rollback drill, postmortem
문법 암기가 덜 중요하다는 말은 코드를 몰라도 된다는 뜻이 아닙니다. 생성된 diff를 읽고 실행 경로·불변식·복잡도·동시성·권한 문제를 추론하려면 코드에 대한 정신적 실행 능력이 여전히 필요합니다.
Context filled from primary sources

원문이 짧게 지나간 개념을 보완하면

Workflow와 Agent는 무엇이 다른가

Anthropic은 workflow를 미리 정의된 코드 경로, agent를 모델이 자신의 과정과 도구 사용을 동적으로 결정하는 구조로 구분합니다. 고정 업무는 workflow가 예측 가능하고, 예상하지 못한 경로가 필요한 업무는 agent가 유연합니다. 복잡성이 늘수록 latency·비용·debugging 부담도 커지므로 가장 단순한 구조에서 시작하라고 권합니다.

Anthropic: Building effective agents

RAG는 왜 grounding 전체가 아닌가

2020년 원 논문에서 RAG는 모델의 parametric memory와 검색 가능한 외부 non-parametric memory를 결합했습니다. 이후 실무의 grounding은 vector search를 넘어 structured query, graph, semantic layer, tool retrieval, 권한 필터, 문서 변환과 freshness까지 포함합니다. 검색 결과를 붙였다고 정확성·보안이 자동 보장되는 것은 아닙니다.

Lewis et al.: RAG 원 논문

Eval은 테스트 케이스 몇 개가 아니다

에이전트는 여러 turn에서 도구를 호출하고 상태를 바꾸므로 최종 답만 채점하면 실패 경로를 놓칩니다. 입력 과제, 실행 환경, tool trace, 중간 state, 최종 outcome을 함께 평가해야 합니다. NIST의 TEVV 관점은 평가를 설계·개발·사용 전 생애주기의 위험관리로 봅니다.

Anthropic agent evals · NIST AI Resource Center

LLM-as-a-judge는 언제 쓰나

자연어 품질처럼 코드로 판정하기 어려운 기준에 유용하지만, judge의 편향·position effect·self-preference·rubric 누락을 가질 수 있습니다. 따라서 작은 human-labeled set으로 judge를 calibration하고, 기계적 조건은 deterministic check로 분리하며, 고위험 판정은 사람에게 남기는 조합이 안전합니다.

이 해석은 Andrew Ng의 ‘deterministic / judge / human을 상황별로 선택하고 eval도 평가하라’는 원칙을 실무 절차로 풀어쓴 것입니다.

Observability는 로그를 많이 쌓는 것이 아니다

Google SRE는 모니터링 목적을 alert, 진단, 시각화, 장기 추세로 구분하고, 사용자 관점의 latency·traffic·errors·saturation 같은 핵심 신호를 권합니다. AI 제품은 여기에 task success, groundedness, refusal, tool failure, token cost, model/version별 품질 slice를 더해야 합니다.

Google SRE: Monitoring distributed systems

Agent 보안은 prompt로 해결되지 않는다

OWASP는 RAG와 fine-tuning이 prompt injection을 완전히 막지 못한다고 명시합니다. 외부 콘텐츠를 untrusted input으로 격리하고, 최소 권한, 결정적 output validation, 고위험 action 승인, adversarial test를 적용해야 합니다. LLM 출력도 downstream 코드에 들어가기 전 사용자 입력처럼 검증해야 합니다.

OWASP Prompt Injection · Improper Output Handling

MCP는 무엇을 해결하고 무엇을 해결하지 않나

MCP는 LLM 애플리케이션이 외부 데이터와 도구를 공통 프로토콜로 연결하게 합니다. 연결 표준이지 신뢰 표준은 아닙니다. 서버가 제공하는 resource·tool의 권한, 입력 검증, 인증, 데이터 경계를 애플리케이션이 별도로 설계해야 합니다.

MCP Specification

왜 데이터 아키텍처가 AI의 시야를 결정하나

모델은 전달받지 못한 사실을 ‘누락됐다’고 보고할 수 없습니다. access pattern, entity identity, temporal history, permissions, provenance가 잘못 설계되면 retrieval도 그 잘못된 표현 위에서만 움직입니다. 그래서 data model은 저장 형식이 아니라 AI가 무엇을 알 수 있는지를 정의하는 epistemic boundary입니다.

Critical analysis

이 지도에서 정말 중요한 것과 주의할 것

1
숨은 중앙축은 eval입니다.

모델·grounding·agent·production·제품 목표를 하나의 개선 루프로 연결합니다. 별도 상위 축은 아니지만 사실상 지도의 운영체제입니다.

2
에이전트는 주니어에게 생산량을 주지만 판단력까지 주지는 않습니다.

초보자는 더 넓은 시스템을 만들 수 있으나 잘못된 schema, 권한 경계, failure mode도 더 빠르게 확대할 수 있습니다. 학습은 생성보다 리뷰·debug·eval에 더 많은 시간을 배정해야 합니다.

3
상위 분류는 상호 배타적 taxonomy가 아닙니다.

AI 앱과 SW 기본기 양쪽에 data·production·security가 나타납니다. 전자는 확률적 AI core 관점, 후자는 전체 애플리케이션 관점입니다. 학습 계획에서는 중복을 하나의 실제 프로젝트로 묶어야 합니다.

4
‘Building agents’와 ‘Using coding agents’를 구분해야 합니다.

전자는 제품 안에 agent runtime을 만드는 기술이고, 후자는 개발자가 자신의 작업을 coding agent에 위임하는 업무 방식입니다. 같은 도구·context·eval 개념을 공유하지만 대상 시스템이 다릅니다.

5
자료 기반이지만 재현 가능한 연구는 아닙니다.

채용공고 수는 공개됐지만 수집 기간·지역·산업·직급·중복 제거·인터뷰 질문·설문 표본·소스 가중치·클러스터 결과는 공개되지 않았습니다. ‘실증적으로 입증된 순위’보다 ‘자료로 보강된 전문가 taxonomy’로 보는 것이 정확합니다.

6
채용공고는 현재 수요를 보지만 미래 역량을 완벽히 보여 주지 못합니다.

기업은 자신이 이해한 역할만 공고에 적고, 신생 업무는 직무명 없이 기존 역할에 섞입니다. 인터뷰와 전문가 판단을 결합한 이유이지만, 어떤 신호가 결과를 주도했는지는 알 수 없습니다.

7
현재는 완성본이 아닙니다.

Using coding agents와 Shaping the build 상세편이 남았습니다. 특히 두 축이 구현 이후의 인간 역할을 설명하므로 전체 메시지의 절반은 앞으로 더 구체화될 가능성이 큽니다.

가장 위험한 오독: “코드 작성은 끝났다”가 아닙니다. 더 정확한 해석은 “코드 생산이 저렴해져 요구사항·구조·검증의 잘못이 더 빨리 증폭된다”입니다.
Practical roadmap

이 지도를 학습 계획으로 바꾸기

아래 순서는 Andrew Ng이 직접 제시한 prerequisite가 아니라, 세 글의 의존 관계를 바탕으로 구성한 실전 순서입니다. 역할을 선택하면 우선해야 할 산출물이 바뀝니다.

1. Thin slice작은 full-stack 서비스를 배포
2. Data & contractschema·API·auth·test
3. AI coreLLM·grounding·agent
4. Eval & opstrace·오류·SLI/SLO
5. Shape & scale사용자·비용·아키텍처 진화

입문·주니어의 우선순위

  • 작은 웹/API 앱을 직접 실행·배포하고 요청 흐름을 설명합니다.
  • 에이전트가 만든 diff를 줄 단위가 아니라 실행 경로와 데이터 흐름으로 리뷰합니다.
  • AI 기능 하나에 20개 이상의 예제와 명확한 pass/fail 기준을 만듭니다.
  • 매 프로젝트에 “무엇을 몰랐고 어떻게 확인했는가”를 기록합니다.

12주 예시

주차학습 목표검증 가능한 산출물
1–2full-stack thin slice, Git, API, auth, DB, 배포공개 가능한 URL, architecture sketch, E2E test
3–4LLM foundation과 eval baseline30+ eval cases, 오류 taxonomy, 모델 선택 기록
5–6grounding과 데이터 품질retrieval benchmark, citation/provenance, freshness check
7–8workflow→agent 복잡성 단계화tool contract, permission matrix, stop condition, trace
9–10production observability와 보안SLI/SLO, dashboard, injection test, rollback drill
11–12shaping the build와 확장 판단사용자 관찰, spec, 비용·latency 실험, 다음 버전 결정
Connection to prior analysis

Paperthin은 이 지도에서 어디에 놓이나

앞서 분석한 Paperthin은 AI 엔지니어링 전체 커리큘럼이 아니라, coding agent를 신뢰성 있게 운전하고 결과를 검증하는 메타 하네스에 가깝습니다.

Andrew Ng 지도Paperthin에서 대응하는 부분남는 공백
Evaluation-driven developmentsip, shower, factchk, mandela, hate실제 제품 eval dataset·metric·experiment 구현
Agentic iterationre0-loop, re0-memo, re0-work, nba실제 agent runtime·tool protocol·memory 구현
Using coding agentsreadchk, aim, modelchk, autobahn, prismIDE·CI·sandbox·permission 운영 기술
Maintainabilityre0, ssotize, debloat, detool코드 아키텍처·DB·distributed system 기본기
Shaping & releasere0-plan, re0-release, re0-merge고객 연구·시장 판단·제품 metric

Paperthin 28개 스킬 상세 분석 열기

Glossary

빠르게 확인하는 핵심 용어

Grounding

모델 출력을 외부 데이터·규칙·도구 결과에 연결해 근거와 최신성을 제공하는 설계.

RAG

질문과 관련된 외부 문서를 검색해 생성 모델의 입력에 결합하는 방식.

Agent harness

모델이 반복적으로 다음 행동을 선택하고 도구를 실행하도록 context·state·permission·loop를 제공하는 실행 환경.

MCP

LLM 애플리케이션과 외부 resource·tool을 연결하는 공개 프로토콜. 권한 안전을 자동 보장하지는 않음.

Eval

AI 시스템의 행동과 결과를 예제·metric·rubric·judge·human review로 측정하는 절차와 데이터.

Error taxonomy

실패 사례를 원인·유형·영향별로 묶어 다음 개선의 우선순위를 정하게 하는 분류 체계.

Drift

시간이 지나 입력 분포·사용자 행동·모델·데이터가 달라져 품질이 변하는 현상.

SLI / SLO

서비스 상태를 나타내는 지표와 그 지표가 충족해야 할 목표. 예: p95 latency와 99.9% availability.

Graceful degradation

일부 의존성이 실패해도 전체 중단 대신 제한된 기능으로 안전하게 계속 동작하는 설계.

Blast radius

한 실패·권한·배포 오류가 영향을 줄 수 있는 시스템과 사용자 범위.

Shift left

보안·테스트·품질 검토를 개발 후반이 아니라 설계와 구현 초기로 이동하는 접근.

Vibe coding

시스템 원리와 trade-off를 충분히 이해하지 않은 채 자연어 지시와 생성 결과만으로 개발하는 방식.

Sources & provenance

원문과 보완 자료

Andrew Ng 공식 글 목록

세 편의 공식 제목과 8월 14·21·28일 발행일을 확인.

andrewng.org/writing
1편: 전체 지도

4대 역량, 10,000+ 채용공고와 인터뷰 방법론, skills-not-title 관점.

X 원문 · 전체 텍스트
2편: AI 앱 구축·배포

6대 하위 역량과 eval/error-analysis 중심의 반복 개발.

X 원문 · 전체 텍스트
3편: 소프트웨어 기본기

full-stack·data·architecture·security/reliability·production의 다섯 영역.

X 원문 · 전체 스레드
Agent architecture

workflow와 agent 구분, 단순 패턴 우선, evaluator-optimizer와 ground-truth loop.

Anthropic
Agent evaluation

multi-turn agent의 task·environment·trace·outcome 평가.

Anthropic · NIST AIRC
AI security

prompt injection, improper output handling, supply chain과 최소 권한.

OWASP GenAI
Production & grounding

서비스 관측의 목적·핵심 신호와 RAG의 원래 정의.

Google SRE · RAG paper