Microsoft Agent 365·M365 E7 GA, Mistral Medium 3.5 SWE-Bench 77.6%로 Devstral 2 교체 — 중국 4개 랩(Z.ai·MiniMax·Moonshot·DeepSeek) 12일 연속 오픈웨이트 코딩 모델 폭격

2026년 5월 8일 금 · 5월 1일 Microsoft Agent 365·M365 E7 'Frontier Suite'가 일반 출시되며 기업용 에이전트 거버넌스 컨트롤 플레인이 표준화됐고, 5월 2일 Mistral Medium 3.5(128B 단일밀집)가 Vibe Remote Agents와 함께 풀리며 SWE-Bench Verified 77.6%로 Devstral 2를 자동 교체했습니다. 같은 기간 Z.ai GLM-5.1·MiniMax M2.7·Moonshot Kimi K2.6·DeepSeek V4가 12일 안에 연쇄 출시되며 중국 오픈웨이트 코딩 모델이 서구 프런티어 가격의 3분의 1 수준으로 동등 성능을 제공하기 시작했습니다.

프레임워크/오케스트레이터

Microsoft Agent 365 + Microsoft 365 E7 'Frontier Suite' 5/1 GA — 에이전트 거버넌스 컨트롤 플레인 표준화, E7 $99/Agent 365 단독 $15
RELEASE9/10

Microsoft가 5월 1일 Microsoft 365 E7 Frontier Suite와 Agent 365를 동시에 GA로 풀었습니다. E7은 M365 E5 + Copilot + Agent 365를 Work IQ 위에 묶은 사용자당 $99 번들이고, Agent 365는 사용자당 $15에 단독 판매되며 Microsoft 자체 에이전트와 서드파티 에이전트를 함께 관찰·통제·보안하는 컨트롤 플레인을 제공합니다. Entra Suite + Defender + Intune + Purview가 에이전트 단위 거버넌스에 그대로 들러붙으며, 'AI 에이전트는 사람이 아니지만 사람처럼 신원·권한·로그를 가진다'는 모델이 처음으로 표준 SKU로 승격된 사례입니다.

Microsoft Tech Community 원문 (새 창)
Coder, '셀프호스팅·모델 무관' AI 코딩 에이전트 표준 발표 (5/6) — 자체 인프라에서 Claude·GPT·DeepSeek 어떤 모델이든 같은 에이전트 하니스로
RELEASE8/10

Coder가 5월 6일 모델 무관·셀프호스팅 'Coder Agents' 표준을 발표했습니다. 클라우드 의존 없이 회사 자체 인프라에서 Claude·GPT-5.5·DeepSeek V4·Mistral Medium 3.5 등 어떤 모델이든 같은 에이전트 하니스로 돌릴 수 있게 만들었고, 데이터·코드·로그가 외부 API로 나가지 않는 환경을 표준 디폴트로 제시합니다. 5/1 Microsoft Agent 365가 통제·거버넌스 측을, 5/6 Coder Agents가 셀프호스팅·모델 다이얼링 측을 가져가며 'AI 코딩 에이전트의 인프라 레이어'가 두 갈래로 분기되는 중입니다.

GlobeNewswire / Coder 원문 (새 창)
OpenClaw 60일 만에 GitHub 25만 스타·React 추월 — 셀프호스팅 영속 AI 어시스턴트, MCP+A2A 위에서 로컬·프라이빗 배포 표준화
8/10

오픈소스 'OpenClaw'가 출시 60일 만에 GitHub 스타 25만을 돌파하며 React를 제치고 GitHub 역대 최다 스타 소프트웨어로 등극했습니다. 로컬 또는 프라이빗 서버에서 돌도록 설계된 셀프호스팅·영속 AI 어시스턴트로, MCP와 Agent2Agent(A2A) 표준 위에 'Skills' 레이어를 얹어 다른 에이전트 네트워크와 상호운용됩니다. NVIDIA Nemotron Labs가 자사 블로그에서 OpenClaw를 사례로 들며 '모든 조직이 자기 데이터에서 떠나지 않는 에이전트를 가질 수 있다'는 시나리오를 설명할 정도로, 5/1 Microsoft Agent 365·5/6 Coder Agents와 함께 'AI 에이전트는 SaaS가 아니라 인프라'라는 메시지를 시장 수준으로 굳혔습니다.

NVIDIA Blog 원문 (새 창)

모델 출시/업데이트

Mistral Medium 3.5 (128B 단일밀집·256k) + Vibe Remote Agents — SWE-Bench Verified 77.6%로 Devstral 2 자동 교체, EU 호환 단일 벤더 풀스택
RELEASE9/10

Mistral이 4월 29일 발표 후 5월 2일 정식 풀린 Medium 3.5가 SWE-Bench Verified 77.6%(Devstral 2 72.2%)·τ³-Telecom 91.4%로 코딩 에이전트 벤치마크를 한 단계 끌어올렸습니다. 256k 컨텍스트에 추론·코딩·비전·에이전트가 한 셋의 가중치로 들어간 128B 단일밀집 모델이고, Mistral의 Vibe CLI 코딩 에이전트가 Medium 3.5를 디폴트로 자동 교체했습니다. 같은 발표에서 Vibe 'Remote Agents'가 공개되며 백그라운드에서 코드 변경을 끝내고 PR을 올리는 클라우드 모드를 EU 데이터 거주성 옵션과 함께 제공해, 단일 유럽 벤더로 풀스택을 가져갈 수 있는 처음의 안이 됐습니다.

Mistral AI 원문 (새 창)
중국 4개 랩 12일 연쇄 — Z.ai GLM-5.1·MiniMax M2.7·Moonshot Kimi K2.6·DeepSeek V4 (Pro 1.6T/Flash 284B, 1M 컨텍스트) 오픈웨이트 출하
RELEASE9/10

4월 말~5월 초 12일 사이에 Z.ai GLM-5.1, MiniMax M2.7, Moonshot Kimi K2.6, DeepSeek V4가 연쇄 출시되며 에이전틱 엔지니어링 상한 부근의 능력을 서구 프런티어 가격의 3분의 1 수준에 제공하기 시작했습니다. DeepSeek V4-Pro는 1.6T 파라미터(49B 활성) MoE, V4-Flash는 284B(13B 활성)이고 두 모델 모두 1M 컨텍스트·384k 출력을 지원하며 Claude Code·OpenClaw·OpenCode와 즉시 호환됩니다. MiniMax M2.7은 데뷔 데모로 자기 자신의 스캐폴드를 100라운드 이상 셀프 최적화했고, Moonshot Kimi K2.6은 12시간 연속 도구 사용 트레이스로 추론 엔진을 Zig로 포팅하는 시연을 공개해 '오픈웨이트가 서구 클로즈드를 따라잡았다'는 인식을 굳혔습니다.

Air Street Press / DeepSeek API Docs 원문 (새 창)
OpenAI GPT-5.5 + Codex 통합 — 4/23 발표·4/24 API 공개, GPT-4.5 이후 첫 풀 리트레인 베이스 모델·옴니모달 단일 시스템
RELEASE9/10

OpenAI가 4월 23일 GPT-5.5를 공식 발표하고 4월 24일 GPT-5.5/5.5 Pro를 API로 풀었습니다. 사내 코드네임 'Spud'로 알려진 이 모델은 GPT-4.5 이후 첫 풀 리트레인 베이스 모델이며, 텍스트·이미지·오디오·비디오를 별도 모델로 스티치하지 않고 단일 시스템에서 처리하는 네이티브 옴니모달 아키텍처입니다. 같은 날 OpenAI의 에이전틱 코딩 앱 Codex가 GPT-5.5로 갈아탔고, OpenAI 자체 측정으로 GPT-5.4 대비 동일 작업에서 더 적은 토큰으로 더 좋은 결과를 내며 멀티스텝 작업·도구 사용·자기 검증에서의 'less hand-holding' 향상이 보고됐습니다. ChatGPT Plus·Pro·Business·Enterprise에 즉시 롤아웃됐고 NVIDIA 인프라 위에서 Codex가 가속됩니다.

OpenAI 원문 (새 창)

코딩 도구

Cursor 5/6 업데이트 — 에이전트 컨텍스트 사용 분해 통계 공개, Rules·Skills·MCP·서브에이전트 단위 진단으로 SDK 시대 디버깅 표준화
RELEASE9/10

Cursor가 5월 6일 SDK 퍼블릭 베타 후속으로 에이전트의 컨텍스트 사용량을 Rules·Skills·MCP·서브에이전트 단위로 분해해 보여주는 통계 패널을 공개했습니다. SDK·CLI·데스크톱 어디서 띄운 에이전트든 동일한 진단 화면에서 어떤 룰이 토큰을 가장 많이 먹고 어떤 MCP가 무거운지 보고, 셋업을 즉시 조정할 수 있게 됐습니다. SDK가 풀린 4월 29일 이래 한 주 만의 후속이며, 코딩 에이전트의 'cost·latency·정확도' 트레이드오프를 화이트박스로 볼 수 있게 만든 의미가 큽니다.

Cursor Changelog 원문 (새 창)

엔지니어링 기법

Microsoft 글로벌 AI Diffusion 리포트 (5/7) — 2026 Q1 AI 사용률 16.3→17.8%로 1.5pp 상승, 첫 분기 단위 글로벌 측정
9/10

Microsoft On the Issues가 5월 7일 발표한 글로벌 AI Diffusion 리포트는 2026년 1분기 전 세계 노동연령 인구의 AI 사용률이 16.3%에서 17.8%로 1.5pp 상승했다고 정량화했습니다. 분기 단위로 전 세계 'AI 사용 인구 비중'이 측정·발표된 첫 사례이고, Vibe Coding·Cowork·Agent 365 같은 도구의 보급률이 산업 보고서가 아니라 거시 지표로 추적되기 시작한 시그널입니다. 같은 리포트는 미국·중국·EU 외에 브라질·인도네시아·UAE의 채택 가속을 강조하며 Frontier Suite 같은 기업 SKU가 글로벌 디퓨전 곡선을 어떻게 끌어올리는지 사례로 듭니다.

Microsoft On the Issues 원문 (새 창)
Apple, 바이브 코딩 앱 단속 본격화 — 'Anything' 3/30 스토어 퇴출 후 5월에도 7~30일 리뷰 지연·업데이트 차단 누적, 가이드라인 2.5.2가 표적
8/10

Apple이 3월부터 시작된 '바이브 코딩 앱' 단속을 5월에도 이어가며 신규 앱 리뷰 시간을 24~48시간에서 7~30일 이상으로 끌어올렸습니다. 'Anything'이 3월 30일 스토어에서 완전 퇴출됐고, Replit·Vibecode 등의 업데이트 차단도 누적되는 중입니다. 표적은 가이드라인 2.5.2 — '앱이 자기 동작을 바꾸는 코드를 다운로드·설치·실행하는 것'을 막는 조항이며, Apple은 '바이브 코딩 자체를 막는 룰은 없다'면서도 '앱이 자기 행동을 App Review 밖에서 바꾸는 것은 허용 안 한다'는 입장을 유지하고 있습니다. 직전 분기 App Store 신규 제출이 84% 폭증한 시점과 정확히 맞물린 단속이라, 모바일 배포 채널이 바이브 코딩의 첫 번째 병목이 될 가능성이 거론됩니다.

Futurism / MacRumors 원문 (새 창)
Anthropic '2026 Agentic Coding Trends Report' 정리 — 개발자 60% 작업 위임 vs 0~20%만 무감독 신뢰, 8대 트렌드 파운데이션·역량·임팩트 3축
9/10

Anthropic의 '2026 Agentic Coding Trends Report'가 5월에 다시 회자되며 8대 트렌드를 파운데이션(개발 자체의 구조 변화)·역량(이전엔 못하던 작업)·임팩트(비즈니스 결과) 3축으로 묶어 제시합니다. 핵심 발견은 '개발자가 작업의 60%를 AI에 위임하지만 무감독으로 완전 신뢰하는 비중은 0~20%에 불과하다'는 것이고, 보안 리뷰·하드닝·모니터링이 더는 전문가만의 영역이 아닌 일반 엔지니어의 평상 업무로 내려왔다고 진단합니다. Rakuten·CRED·TELUS·Zapier·Legora·Fountain·Augment Code 사례를 통해 'AI 자동완성의 시대는 끝났고, 자율 에이전트의 시대가 시작됐다'는 프레임을 확정했습니다.

Anthropic 원문 (새 창)