보고서 해설
월가 주요 투자은행의 최신 리서치 커버
리서치 보고서 해설Hilo Research

Artificial intelligence 리서치 보고서 해설

Citi는 재귀적 자기개선의 초기 신호, 낮아진 추론 비용 및 개선된 애플리케이션 하네스가 AI 지능 플라이휠을 확대하고 있다고 주장한다. 안전성과 정렬에 더 많은 컴퓨팅을 배분하더라도 AI 수요 관련 글로벌 CapEx가 2026년$1T, 2027년$1.6T에 이를 것이라는 전망은 바뀌지 않을 가능성이 높다고 본다.

기관Citigroup
날짜20260918
업종Artificial intelligence

요약

Citi는 재귀적 자기개선의 초기 신호, 낮아진 추론 비용 및 개선된 애플리케이션 하네스가 AI 지능 플라이휠을 확대하고 있다고 주장한다. 안전성과 정렬에 더 많은 컴퓨팅을 배분하더라도 AI 수요 관련 글로벌 CapEx가 2026년$1T, 2027년$1.6T에 이를 것이라는 전망은 바뀌지 않을 가능성이 높다고 본다.

특정 대상에 대한 등급이나 목표주가는 없다.
인공지능추론재귀적 자기개선컴퓨팅 수요AI 인프라모델 출시AI 안전성에이전트 하네스
  • 평균 실제 서빙 비용은 5월 28일 고점 대비 54%, 7월 1일 이후 43% 하락했다.
  • Z.ai의 Infra Agent는 2주 미만에 GLM-5.3-Flash를 운영 환경에 배포했고 100,000개 초과 가속기에서 처리량을 3배로 늘렸다.
  • 프로바이더 어댑터 하네스는 ARC-AGI-3 성능을 62.71%에서 99.95%로 높이고 비용을 28% 낮췄다.
  • 해당 주에는 독점 모델 1개와 오픈 모델 3개만 출시됐지만, 최근 90일 출시 수는 독점 모델 68개와 오픈 모델 40개였다.

보고서 해설

개요

이 Citi AI 산업 업데이트는 재귀적 자기개선, 추론 비용 하락 및 애플리케이션 계층의 진전이 실제 AI 지능과 인프라 수요를 복리처럼 높일 수 있는지를 검토한다. 핵심 결론은 안전성과 정렬 작업이 컴퓨팅 배분을 바꿀 수는 있지만, 전체 컴퓨팅 수요와 AI 투자 사이클을 줄이기보다 늘릴 가능성이 높다는 것이다.

핵심 견해

Citi는 재귀적 자기개선(RSI)의 초기 증거를 새로운 컴퓨팅 수요원이 될 수 있는 요인으로 본다. Google의 Dream-RSI 및 관련 진전은 모델이 후속 모델 개발에 점점 더 기여할 수 있음을 시사한다. Citi에 따르면 논점은 모델 출시 시점에서 희소한 컴퓨팅 자원의 배분으로 옮겨가고 있다. Meta가 안전성을 우선하기 위해 Muse를 연기했다는 보도와, 대부분의 컴퓨팅이 RSI 경쟁보다 사용자 서비스에 쓰인다는 발언은 프런티어 개발이 안전성, 감사 가능성 및 정렬과 균형을 맞추고 있음을 보여준다. 그럼에도 Citi는 이 같은 재배분이 AI 수요 관련 글로벌 CapEx 전망인 2026년$1T와 2027년$1.6T를 바꾸지는 않을 것으로 본다. 보고서는 인프라 자동화를 RSI로 가는 중요한 연결고리로 평가한다. Z.ai의 Infra Agent는 GLM-5.3-Flash를 2주 미만에 운영 환경에 배포하고, 100,000개 초과 가속기에서 처리량을 3배로 늘렸으며, 6일 동안 62T 초과 토큰 처리에 기여한 것으로 알려졌다. Citi는 이 도구가 RSI와는 아직 거리가 멀다고 강조하면서도, 자율 최적화가 모델 개발을 가속하고 추론 및 거버넌스 인프라 수요를 높일 수 있다고 본다. 고도화된 사이버보안 기능으로 인한 GLM-5.3 가중치 공개 지연과 AI Infra Summit에서의 논의는 안전성과 정렬에 컴퓨팅을 배분하는 것이 전체 컴퓨팅 요구량을 늘릴 수 있다는 견해를 뒷받침한다. 낮아진 배포 비용과 효율성 향상은 상호 보완적인 수요 동인으로 제시된다. Unsloth의 GLM-5.3 양자화는 약81%의 정확도를 유지하면서 모델 크기를 83% 줄여 온프레미스 메모리와 가속기 요구량을 낮췄다. Citi는 배포 장벽 하락이 온프레미스 AI 도입을 넓히고 민감한 데이터에 대한 통제를 개선하며 대규모 RSI의 기반을 마련할 수 있다고 주장한다. 이는 Ramp가 기록한 7개 부문 중 6개 부문의 전월 대비 도입 증가와 일치한다. 별도로 평균 실제 서빙 비용은 5월 28일 고점 대비 54%, 7월 1일 이후 43%, 전주 대비 2% 하락했으며, Citi는 이를 내부 및 외부 사용 증가의 순풍으로 본다. 최신 주의 모델 출시 속도는 둔화됐다. 독점 모델 1개와 오픈 모델 3개가 출시돼 전주의 5개와 6개, 4주 전의 3개와 6개를 밑돌았다. 그러나 최근 90일 기준 수는 독점 모델 68개, 오픈 모델 40개에 달했다. 9월 초 급증 이후 독점 모델 출시는 전월 대비 31% 증가했고, 오픈 모델은 보합이었다. Citi는 또한 8월 1일 이후 출시의 약69%가 해당 프로바이더의 새로운 지능 최고치를 세웠다고 보고했다. 월말 무렵 프런티어 프로바이더의 모델 출시가 있을 수 있다는 미확인 추측은, 모델 라우팅이 확산되는 상황에서도 성능 향상이 프리미엄 사용을 재유도할 수 있는지를 시험할 수 있다고 지적한다. 마지막으로 Citi는 실제 구현되는 지능의 핵심 결정 요인이 기반 모델뿐 아니라 하네스 설계가 되고 있다고 주장한다. 대화형 ARC-AGI-3 벤치마크에서 동일한 모델에 프로바이더 어댑터 하네스를 추가하자 성능은 62.71%에서 99.95%로 37퍼센트포인트 상승했고, 비용은 $26.1K에서 $18.8K로 28% 하락했다. Salesforce도 기반 모델을 바꾸지 않고 에이전트 하네스를 발전시켜 7개 엔터프라이즈 에이전트 과제의 평균 성공률을 29.2%에서 78.0%로 높였다. Citi는 실제 지능 향상에서 하네스가 차지하는 비중이 커지면서 애플리케이션 계층이 프로바이더와 기업의 차별화 원천으로 중요해질 것이라고 결론 내린다.

분석 프레임워크

Citi는 모델 출시, 지능 벤치마크, 가격 및 사용 지표의 주간 추적과 AI 인프라, 배포 최적화, 에이전트 하네스 설계 사례 연구를 결합한다. 이를 컴퓨팅 배분, 도입 및 AI 관련 자본지출에 대한 함의와 연결한다.

방법론 메모

  • 산업 분석 프레임워크수급 프레임워크

    AI 컴퓨팅 수급 및 서빙 비용 분석

    Citi는 서빙 비용, 컴퓨팅 배분, 모델 출시 및 인프라 효율성의 변화를 활용해 AI 수요와 컴퓨팅 요구량이 어떻게 전개될 수 있는지 평가한다.

  • 산업 분석 프레임워크산업 가치사슬 상·중·하류 전이

    AI 인프라에서 배포로의 전파

    이 보고서는 인프라 자동화와 모델 메모리 요구량 감소를 더 폭넓은 배포, 추론 사용, 거버넌스 수요 및 AI 컴퓨팅 수요와 연결한다.

핵심 데이터

  • AI 수요 관련 글로벌 CapEx$1T in 2026; $1.6T in 2027Citi의 전망이며, 안전성과 정렬에 대한 컴퓨팅 배분이 늘어나도 유지될 것이라고 본다.
  • 평균 실제 서빙 비용Down 54% from the May 28 peak, 43% since July 1, and 2% WoWCiti는 서빙 비용 하락을 사용량 증가의 순풍으로 본다.
  • Z.ai Infra Agent 처리량Tripled across 100K+ accelerators; 62T+ tokens processed in 6 days이 시스템은 GLM-5.3-Flash를 2주 미만에 운영 환경에 배포했다.
  • GLM-5.3 양자화~81% accuracy; 83% smallerCiti는 Unsloth 양자화를 온프레미스 메모리 및 가속기 요구량을 낮추는 사례로 제시한다.
  • 최신 모델 출시1 proprietary and 3 open전주의 5개와 6개에서 하락했으며, 최근 90일 합계는 독점 모델 68개와 오픈 모델 40개였다.
  • ARC-AGI-3 하네스 결과99.95% from 62.71%; $18.8K from $26.1K동일 모델에서 프로바이더 어댑터 하네스는 성능을 37퍼센트포인트 높이고 비용을 28% 낮췄다.
  • Salesforce 엔터프라이즈 에이전트 과제 성공률78.0% from 29.2%7개 과제의 개선은 기반 모델 변경이 아니라 에이전트 하네스의 발전에서 비롯됐다.

영향과 시사점

Citi의 분석은 효율성 향상이 반드시 AI 인프라 수요를 줄이지는 않는다는 점을 시사한다. 비용 하락은 사용과 배포를 확대할 수 있는 반면, RSI 지향 개발과 안전성, 정렬 및 거버넌스 작업은 컴퓨팅 요구량을 추가할 수 있다. 또한 하네스 설계가 애플리케이션 계층에서 경쟁 차별화의 중요한 원천으로 부상하고 있음을 강조한다.

위험

  • GLM-5.3 사례에서처럼 고도화된 사이버보안 기능은 모델 가중치 공개를 지연시킬 수 있다.
  • 안전성, 감사 가능성 및 정렬 요구사항은 프런티어 모델용 컴퓨팅의 속도와 배분을 바꿀 수 있다.

주시할 점

  • 월말 무렵 프런티어 프로바이더의 모델 출시가 모델 라우팅 환경에서도 성능 향상만으로 프리미엄 사용을 재유도할 수 있는지.
  • 프로바이더가 사용자 서비스, 모델 개발, 안전성, 감사 가능성 및 정렬 사이에서 컴퓨팅을 어떻게 배분하는지.
  • 추론 서빙 비용, 모델 출시 속도 및 배포 효율성의 추가 변화.
  • Meta Connect, OpenAI DevDay, OCP Global Summit 및 NVIDIA GTC를 포함한 향후 AI 및 인프라 행사.
저장 ICP 제2022035445-5호
면책 고지: 이 웹사이트가 제공하는 시장 데이터, 차트, 지표, 리서치 견해 및 기타 정보는 오직 정보 표시, 리서치 소통, 교육적 참고를 위한 것입니다. 개인화된 투자 자문, 증권 추천, 거래 지시, 권유, 수익 보장으로 간주해서는 안 됩니다. 데이터와 콘텐츠의 신뢰성을 높이기 위해 노력하지만 출처 차이, 방법론적 한계, 시스템 처리, 시장 변동으로 지연, 오류, 불완전, 업데이트 지연이 발생할 수 있습니다. 사용자는 자신의 상황에 따라 독립적으로 판단하고 이 웹사이트 사용에 따른 모든 위험과 책임을 부담해야 합니다.

설정

최근 로그인을 보려면 로그인하세요