Cursor SDK 공개와 Stanford AI Index 2026 — 코딩 에이전트가 '인프라'로 전환되는 분기점

2026년 5월 2일 토 · Cursor가 4월 29일 TypeScript SDK를 퍼블릭 베타로 공개해 데스크톱·CLI·웹 앱과 동일한 에이전트 런타임을 코드 몇 줄로 호출 가능한 프로그래머블 인프라로 전환했고, 같은 시기 발표된 Stanford AI Index 2026은 SWE-bench Verified가 60%→100% 근접, OSWorld가 12%→66.3%로 도약했음을 공식 기록했습니다. GitHub Copilot의 사용량 기반 과금 전환(6/1)과 Cognition $25B 평가 협상까지 더해져 산업이 'AI 에이전트=인프라' 단계로 확정 진입했습니다.

코딩 도구

Cursor TypeScript SDK 퍼블릭 베타 — 데스크톱·CLI·웹 동일 에이전트 런타임을 프로그래머블 인프라로 개방
RELEASE10/10

Cursor가 4월 29일 @cursor/sdk를 퍼블릭 베타로 공개했습니다. 자동 코드베이스 인덱싱, 시맨틱 검색, MCP 서버, Skills, 훅, 서브에이전트, 샌드박스 클라우드 실행 등 데스크톱 앱과 동일한 하네스를 TypeScript 몇 줄로 호출할 수 있고 로컬 머신·전용 VM 양쪽 실행을 지원합니다. 토큰 기반 과금(기본 Composer 2 Standard $0.50/$2.50)으로 전환하며 Rippling·Notion·Faire·C3 AI가 이미 프로덕션 도입을 시작했습니다.

Cursor 원문 (새 창)
GitHub Copilot, 6월 1일부터 사용량 기반 과금 전환 — 토큰 단위 AI Credits 도입
RELEASE10/10

GitHub가 4월 모든 Copilot 플랜을 2026년 6월 1일자로 사용량 기반 과금으로 전환한다고 발표했습니다. 월간 AI Credits를 구독료에 포함시키고 Business는 $19, Enterprise는 $39 상당의 크레딧을 기본 제공하며 입력·출력·캐시 토큰 모두 모델별 API 단가로 차감합니다. Pro·Pro+ 가격은 그대로($10·$39)이며 코드 자동완성과 Next Edit는 크레딧을 소비하지 않습니다. 5월 초 청구서 미리보기 기능이 GitHub Billing 페이지에 공개됩니다.

The GitHub Blog 원문 (새 창)
Cognition AI, $25B 평가로 펀딩 협상 — Devin·Windsurf 통합 후 ARR 두 배 성장
9/10

Bloomberg가 4월 23일 보도한 바에 따르면 Devin 개발사 Cognition AI가 약 250억 달러 평가에 수억 달러 펀딩 라운드를 협상 중입니다. 직전 102억 달러 평가의 2.5배 수준으로, 2025년 7월 Windsurf 인수 이후 ARR이 2배 가까이 늘어난 결과입니다. Devin ARR은 2024년 9월 100만 달러에서 2025년 6월 7,300만 달러로 73배 성장했고, 4월 출시한 Windsurf 2.0과 Agent Command Center가 자율 코딩 에이전트 매출 가속의 핵심 동력으로 평가됩니다.

Bloomberg 원문 (새 창)
Cognition Windsurf 2.0 출시 — Devin Cloud 에이전트와 Agent Command Center 내장
RELEASE10/10

Cognition AI가 4월 15~16일 Windsurf 2.0을 공개해 자율 에이전트 Devin을 IDE에 직접 내장했습니다. 로컬 Cascade 세션과 클라우드 Devin 세션을 단일 Agent Command Center에서 관리하고 Spaces로 작업 단위 그룹화가 가능하며, 로컬에서 계획한 작업을 원클릭으로 클라우드 Devin에 위임해 노트북을 닫아도 실행이 이어집니다. Devin은 모든 Self-serve 플랜(Pro·Max·Teams)에 기본 포함되며 Cascade 단축키와 사이드바 통합으로 컨텍스트 전환 비용을 제거했습니다.

Windsurf 원문 (새 창)
Cursor Cookbook 공개 — agent-kanban으로 카드 드래그 한 번에 PR 자동 생성
TUTORIAL8/10

Cursor가 SDK 출시와 함께 cursor/cookbook 리포지토리를 공개해 4개 스타터 프로젝트를 제공합니다. 그중 sdk/agent-kanban은 Linear 스타일 보드에서 카드를 다른 컬럼으로 드래그하면 클라우드 에이전트가 격리된 VM에서 코드를 작성하고 GitHub PR을 자동 생성, 결과 아티팩트(스크린샷·로그·출력)를 카드에 첨부합니다. Next.js·TypeScript·pnpm·shadcn/ui 기반으로 상태·리포·브랜치·생성일 기준 컬럼 구성이 가능하며 Cloud Agent 워크플로 시각화의 레퍼런스 구현으로 자리매김했습니다.

Cursor 원문 (새 창)
GitHub Copilot Code Review, 6월 1일부터 GitHub Actions 분 소비 — PR 리뷰 단가 가시화
RELEASE9/10

GitHub가 4월 27일 Copilot Code Review의 PR 리뷰 실행도 2026년 6월 1일부터 GitHub Actions 분을 소비한다고 공식 발표했습니다. 같은 날 발효되는 Copilot 사용량 기반 과금과 결합돼 'AI 리뷰=공짜'에서 'AI 리뷰=러너 분+토큰' 모델로 전환되며, 빈번한 자동 리뷰가 활성화된 팀은 월간 비용 추정과 러너 한도 재산정이 필요합니다. 코드 자동완성과 Next Edit는 크레딧·러너 분 모두 면제됩니다.

GitHub Changelog 원문 (새 창)
GitHub CLI에 'gh skill' 명령 추가 — 에이전트 스킬 단일 명령 설치·관리
RELEASE8/10

GitHub가 4월 16일 GitHub CLI에 'gh skill' 명령을 추가해 Copilot 에이전트 스킬을 한 줄 명령으로 설치·목록 확인·제거할 수 있게 했습니다. SKILL.md 표준 포맷(YAML 프런트매터+마크다운 본문)을 사용해 Copilot 외에 Claude Code·Cursor·Codex CLI 등 20개 이상 에이전트와 동일 파일을 공유 가능하며, .github/skills·.claude/skills·.agents/skills 등 다중 디렉터리에서 자동 디스커버리됩니다. 같은 시기 클라우드 에이전트 시작 시간이 GitHub Actions 커스텀 이미지 최적화로 20% 이상 단축됐습니다.

GitHub Changelog 원문 (새 창)

엔지니어링 기법

Stanford AI Index 2026 공개 — SWE-bench Verified 60%→100% 근접, OSWorld 12%→66.3% 도약
10/10

Stanford HAI가 4월 발표한 AI Index 2026은 1년 사이 코딩·에이전트 능력의 비약적 진전을 공식 기록했습니다. SWE-bench Verified는 약 60%에서 100%에 근접하게 상승했고, OSWorld 컴퓨터 사용 벤치마크는 12%에서 66.3%로 도약해 인간 성능과 6%p 이내 격차로 좁혀졌습니다. Terminal-Bench도 2025년 20%→2026년 77.3%, 사이버보안 에이전트는 2024년 15%→93%로 상승했고 소프트웨어 개발 생산성 26% 증가가 별도로 보고됐습니다.

Stanford HAI 원문 (새 창)
Cursor Composer 실시간 RL 도입 — 실제 사용자 피드백으로 5시간마다 모델 재배포
9/10

Cursor가 4월 Composer에 'real-time RL'을 도입해 시뮬레이션·오프라인 라벨이 아닌 실제 사용자 상호작용을 보상 신호로 사용하기 시작했습니다. 수십억 토큰의 사용자 응답을 보상으로 변환→가중치 업데이트→CursorBench 평가→체크포인트 배포까지 약 5시간 사이클을 돌리며 하루 여러 번 Auto 뒤의 Composer를 갱신합니다. A/B 테스트 결과 코드베이스 편집 잔존율 +2.28%, 불만족 후속 요청 −3.13%, 지연 −10.3%를 기록했고, 보상 해킹 방지를 위해 행동 모니터링과 보상 함수 동적 수정을 병행합니다.

Cursor 원문 (새 창)

모델 출시/업데이트

Claude Mythos Preview, SWE-bench Pro 1위 등극 — Claude Opus 4.7 정식판 추월
8/10

Scale AI의 SWE-bench Pro 퍼블릭 리더보드 4월 30일 갱신본 기준 Anthropic의 Claude Mythos Preview가 77.8%로 1위에 올라 Claude Opus 4.7 Adaptive(64.3%)와 GPT-5.5(58.6%)를 앞섰습니다. Mythos는 일부 파트너에게만 제한 공개된 미공개 모델로 Claude Code 소스 유출에서 'Sonnet 4.8' 'Opus 4.8' 식별자와 함께 식별됐고, 한 단계 위 차세대 라인업으로 추정됩니다. SWE-bench Pro는 인간 검증 실제 깃 이슈로 구성돼 Verified보다 난이도가 높습니다.

Scale AI 원문 (새 창)