AI Wave 속 인사이트
-
에이전트 브라우저는 왜 ‘더 빠른 Chromium’이 아니라 ‘작업별 격리’로 가는가
Cloudflare가 공개한 Kitesurf는 AI 에이전트의 브라우징을 사람용 브라우저의 축소판이 아니라, 짧게 실행되고 폐기되는 인프라 작업으로 다시 정의한다. 비용 절감 수치보다 중요한 것은 어떤 작업을 이 방식에 맡기고 어디에서 기존 Chromium으로 되돌릴지 판단하는 기준이다.
-
같은 모델 크기인데 에이전트 성능이 달라졌다: DeepSeek V4-Flash-0731을 평가하는 법
DeepSeek V4-Flash-0731은 새 아키텍처 대신 재학습으로 에이전트 작업 성능을 끌어올렸다고 발표됐다. 이번 변화는 새 모델을 곧바로 도입하기보다, 실제 워크플로에서 무엇이 달라졌는지 작은 회귀 테스트로 확인해야 하는 이유를 보여준다.
-
AI 에이전트 성능은 모델만의 점수가 아니다: 기억과 압축을 평가에 넣는 법
최근 ARC-AGI-3 사례는 같은 모델도 대화 상태와 컨텍스트 처리 방식에 따라 결과가 크게 달라질 수 있음을 보여준다. 에이전트를 만들거나 도입할 때 모델 비교표와 별도로 ‘기억 정책’을 평가해야 하는 이유를 정리한다.