검색 - IT세상을 바꾸는 힘 지디넷코리아

ZDNet 검색 페이지

'이미지 생성'통합검색 결과 입니다. (17건)

태그
기간
- 3개월
- 1년
- 1년 이전

재검색

[기고] 인간이 직접 만든 콘텐츠입니다

챗GPT 등장 이후 인공지능(AI)과 신기술, 혁신적인 서비스의 개발을 해하지 않으면서도 이용자의 권리와 개인정보를 보호하려면 어떤 것을 고려해야 할 지에 대한 논의가 최근 활발해진 분위기다. 급변하는 정보사회에서 AI와 개인정보 보호에 있어 우리 사회가 취해야 할 균형 잡힌 자세가 어떤 것인지에 대해 법무법인 태평양 AI팀에서 [AI 컨택]을 통해 2주 마다 다뤄보고자 한다. [편집자주] A씨는 건강을 위해 달리기로 결심했다. 혼자 뛰다 보니 여러 명이 함께 달리는 러닝 크루들이 보였고, A씨도 러닝 크루를 만들어 뛰는 것이 더 재미있을 것 같았다. A씨는 달리기 모임을 만들고 신규 회원 모집에 나섰다. 회원을 모집하려니 모임을 상징하는 이미지가 있으면 좋겠다는 생각이 들었다. 아쉽게도 A씨는 상상력은 풍부한 편이지만 그림 그리기에 영 소질이 없다. 하지만 걱정할 필요가 없다. A씨는 머리에 떠오른 이미지를 AI에게 설명하고 이미지를 만들어 보라고 시킨다. AI가 만든 이미지를 보며 A씨가 몇가지 수정 아이디어를 주니 꽤 쓸만한 이미지가 나온다. AI가 발전하면서 흔히 볼 수 있게 된 모습이다. 이미지뿐 아니라 AI를 이용해 프롬프팅으로 영상이나 음악, 애플리케이션을 만들기도 한다. 개인 취미 활동에만 이용되는 것이 아니다. 한국콘텐츠진흥원에 따르면 국내 콘텐츠 산업 종사자들이 생성형 AI를 이용하는 비율이 2025년 상반기에 20%에 달했다. 지난 2024년 하반기보다 약 7% 늘어난 것이라고 하니 1년이 지난 지금은 그 비율이 훨씬 높아졌을 것이다. AI는 콘텐츠 제작에 많은 도움을 주고 있지만 악용되는 사례도 많다. AI를 이용해 마치 진짜인 것처럼 만들어 내는 딥페이크에 대해 일반인들이 조작된 것인지 확인하기는 쉽지 않다. 특정 세력 여론몰이나 트래픽을 늘려 수익을 얻기 위해서 등 다양한 목적으로 딥페이크가 쏟아지고 있다. 최근 중동에서 일어난 이란 전쟁을 예로 들어 보자. 이란 전쟁은 다양한 방향에서 AI가 본격적으로 이용된 전쟁으로 볼 수 있는데, AI로 가짜 사진이나 동영상을 정교하게 생성하여 여론에 혼란을 주기도 했다. 예를 들어 아랍에미리트 두바이에 있는 세계 최고층 건물 부르즈 할리파가 드론 공습을 받는 사진과 동영상이 사회관계망서비스(SNS) 등에 널리 퍼졌지만 AI로 생성되거나 변경된 가짜 이미지로 확인이 됐다. 딥페이크가 광고에 도입되면 더 혼란을 줄 수 있다. 어느 분야의 권위있는 인물 이미지를 활용해 어떤 제품을 권하는 것처럼 합성한다거나, 의약품의 경우 사용 전후 변화 이미지를 AI를 이용해 효과를 과장할 수도 있다. 이런 문제로 인해 AI가 생성한 결과물이라는 사실을 알리도록 하는 방안이 추진되고 있다. 옛 트위터인 엑스(X)는 무력 충돌을 다룬 영상과 이미지를 AI로 생성할 때 AI 생성 결과물임을 밝히지 않고 게시하는 이용자에게 광고 수익 공유를 중단하겠다고 발표했다. AI를 이용해 생성한 실제와 구분하기 어려운 이미지, 영상 등 딥페이크에 대해 'AI를 이용해 생성됐다'는 사실을 이용자가 명확하게 알 수 있도록 표시할 의무를 법제화하려는 움직임도 나타난다. 유럽연합(EU)은 'AI 액트(Act)'에서 AI 시스템 배포자(deployer)에게 딥페이크 콘텐츠가 인위적으로 생성 또는 조작됐다는 것을 공개하도록 정하고 있다. 이에 EU는 실시간 영상, 비(非)실시간 영상, 이미지, 오디오 등 콘텐츠 종류별로 딥페이크임을 표시하는 방법에 대한 가이드라인을 발표했다. 우리나라도 텍스트, 이미지, 동영상, 음성 등 콘텐츠 종류 별로 표시 방법에 대한 가이드라인이 나와 있다. 최근 국회 본회의를 통과한 의료기기법 개정안은 딥페이크를 활용하여 관련 분야 전문가가 의료기기를 보증, 추천 등 하는 것으로 오인하게 할 우려가 있는 광고를 금지했다. 공정거래위원회도 AI로 만든 가상인물을 활용한 광고에 '가상 인물이 포함된 게시물'이라는 사실을 알리도록 한 심사지침 개정안을 행정예고했다. 국회엔 딥페이크를 직접 제작하거나 편집하여 제공하려는 자에게 해당 정보가 AI 생성물임을 나타내는 표시를 하도록 의무화하는 정보통신망법 일부 개정안도 발의돼 있다. 이용자에게 AI를 이용해 만든 결과물이라는 사실을 명확히 알리는 방향으로 제도가 정비되고 있다. 갈수록 우리가 보는 콘텐츠에 'AI를 이용해 만든 결과물'이라는 표시가 많이 보일 것이다. 그렇다면 AI를 이용하지 않고 오직 인간 힘으로 모든 과정을 해 낸 콘텐츠는 수제품과 같은 지위를 갖게 되는 것일까.

2026.05.21 17:31유재규 컬럼니스트

글자만 번역하던 시대 끝…브랜드 감성까지 살리는 AI 뜬다

해외 판매용 상품 상세 페이지를 여러 언어로 바꾸는 작업은 이커머스 업계의 대표적인 수작업 영역으로 꼽힌다. 최근 단순 번역을 넘어 원본 이미지의 글자 색상이나 강조 효과까지 유지하려는 수요가 커지면서, 디자인 보존형 이미지 번역 기술 경쟁도 본격화하는 분위기다. 16일 플리토에 따르면 지난달 '이미지 번역 프로(Image Translation Pro)'를 출시한 이후 중국을 비롯한 해외 크로스보더 이커머스 기업들의 도입 문의가 이어지고 있다. 플리토는 올리브영, 졸스 등 글로벌 뷰티·패션 라이프스타일 플랫폼과 협업하며 국내외 대량 이미지 번역 시장을 공략 중이다. 이미지 번역 프로는 응용 프로그램 인터페이스(API) 기반으로 제공되는 이미지 번역 솔루션으로, 이미지 속 텍스트를 번역하면서도 원본 디자인 요소를 최대한 유지하는 데 초점을 맞췄다. 문장 내 특정 단어에만 적용된 색상이나 강조 효과를 인식해 번역 이후에도 동일한 형태로 복원하는 '텍스트 속성 인식' 기술이 적용됐다. 예를 들어 상품 배너에서 특정 키워드만 빨간색이나 굵은 테두리로 강조된 경우 번역 결과물에서도 같은 위치와 디자인 속성을 유지하는 식이다. 기존 이미지 번역 서비스가 텍스트 변환 자체에 초점을 맞췄다면 플리토는 브랜드 톤앤매너 유지까지 고려했다. 제품 패키지 내부 텍스트를 자동으로 구분하는 '스마트 필터링' 기능도 탑재했다. 인공지능(AI)이 상품 용기에 인쇄된 브랜드 로고나 성분 정보 등은 번역 대상에서 제외하고, 마케팅 문구만 선별적으로 번역해 실제 제품 이미지와의 이질감을 줄이는 방식이다. 플리토는 이런 기능이 글로벌 이커머스 운영 과정에서 반복적으로 발생하는 상세페이지 수정 작업을 줄이는 데 도움이 될 것으로 보고 있다. 회사 측에 따르면 A4 기준 이미지 한 장은 약 5~10초 내 처리 가능하며 수동 편집 대비 작업 시간을 90% 이상 단축할 수 있다. 실제 시장에선 크로스보더 이커머스 확대와 함께 상품 상세페이지 현지화 수요도 꾸준히 증가하는 모습이다. 국가별 언어에 맞춰 대량 이미지를 반복 수정해야 하는 만큼, 디자인 요소를 유지하면서도 작업 효율을 높일 수 있는 자동화 기술 도입이 늘어나는 추세다. 업계 관계자는 "최근 생성형 AI 기반 이미지 제작 기술이 주목받지만 이커머스 현장에선 비용과 처리 속도 부담이 여전히 존재한다"며 "대량 상품 이미지를 빠르게 현지화하면서도 브랜드 디자인을 유지할 수 있는 실무형 AI 수요가 커지고 있다"고 말했다.

2026.05.16 15:22이나연 기자

정체불명 이미지 AI '덕테이프'…나노바나나 대항마 될까

오픈AI의 차기 이미지 생성 인공지능(AI) 모델로 추정되는 '덕테이프(Duck-Tape)'가 주목받고 있다. 기존 이미지 생성 AI가 넘지 못했던 한글 렌더링 장벽을 사실상 허문 것으로 평가받으면서다. 19일 업계에 따르면 덕테이프는 AI 블라인드 테스트 플랫폼 '아레나 AI'에서 테스트 중인 이미지 생성 모델이다. 아레나 AI는 이용자가 프롬프트를 입력하면 모델명이 가려진 두 결과물을 비교 평가하는 방식으로 운영된다. 이용자가 선호하는 결과물을 선택한 뒤에야 어떤 모델이었는지 공개된다. 덕테이프가 주목받는 이유는 성능이다. 기존 이미지 생성 AI는 한글이 포함된 이미지를 생성할 때 글자가 깨지거나 뭉개지는 오류가 빈번했다. 덕테이프는 복잡한 한글 문장은 물론 간판, 말풍선, 손글씨 노트까지 오류 없이 구현한다는 평가를 받고 있다. 업계에선 광고 시안 품질이 전문 그래픽 디자이너 수준이라는 반응이 나온다. 업계에선 덕테이프가 오픈AI 차기 이미지 모델의 코드네임일 것으로 확실시하는 분위기다. 오픈AI는 과거에도 새로운 모델을 출시하기 전 아레나 AI 등에 익명으로 모델을 올려 성능을 검증해 왔다. 다만 덕테이프는 코드네임인 만큼 공식 출시 시 실제 모델명은 달라질 수 있다. 이미지 생성 기능은 AI 서비스 점유율 경쟁의 핵심 전선이다. 오픈AI는 지난해 상반기 챗GPT를 활용한 일본 지브리풍 이미지 제작이 온라인을 중심으로 유행하면서 유료 가입자를 단기간에 수백만 명 늘렸다. 구글 딥마인드도 지난해 8월 '나노바나나 프로'를 공개하면서 제미나이 신규 이용자 1000만 명을 끌어모았다. 이후 2억 건 이상의 이미지 편집이 이뤄지며 앱스토어 1위에 오르기도 했다. 오픈AI는 연내 기업공개(IPO)를 앞두고 실적 반등이 절실한 상황이다. 오픈AI는 지난달 AI 영상 생성 도구 '소라' 서비스를 전격 종료했다. 소라는 하루 최대 1500만 달러의 추론 비용을 소진하면서도 전체 서비스 기간 수익은 210만 달러에 그쳤다. 최근엔 소라 팀을 이끌었던 빌 피블스, 최고제품책임자(CPO) 출신의 케빈 웨일 부사장 등 핵심 임원들이 잇따라 이탈하며 내부 불안감도 커지고 있다. 개발자 피터 레벨스는 X(옛 트위터)에 덕테이프 모델이 "세계 지식 이해도가 극히 높고 텍스트 렌더링이 뛰어나다"며 나노바나나 프로를 능가할 수 있다고 말했다.

2026.04.19 20:00이나연 기자

한국신용데이터 "직접 만든 AI모델, 이미지 제작 일주일→1분"

한국신용데이터가 자체 이미지생성 인공지능(AI) 모델을 개발했다. 약 한 달 반 만에 만든 생성형 AI 모델인 '캐시노트 AI 비주얼 젠'은 기존 서비스처럼 원하는 프롬프트를 입력하면 약 1분 내외로 이미지를 뚝딱 만들어낸다. 단순히 필요한 이미지가 아니라 한국신용데이터의 브랜드 특성과 디자인 정체성이 반영돼 곧바로 업무에 활용할 수 있는 것이 기존 모델과의 차별점이자 특징이다. '캐시노트 AI 비주얼 젠' 개발을 이끈 인물은 이지스 브랜드 디자이너다. 그는 한국신용데이터가 만든 경영 관리 서비스 '캐시노트'의 브랜드 디자인과 자회사 5곳의 기업 브랜드를 맡고 있다. 이지스 한국신용데이터 브랜드 디자이너는 지난 11일 강남구 사무실에서 지디넷코리아와 진행한 인터뷰에서 '캐시노트 AI 비주얼 젠' 개발 과정을 소개했다. “다양한 소상공인들이 캐시노트 서비스를 이용하는 만큼 각 도메인의 특성을 포괄할 수 있는 지식재산권(IP)을 만들고자 했다. 한국신용데이터의 브랜드 특성, 디자인 톤앤매너, 컬러와 형태에 대한 규칙을 시스템화했다.” 캐시노트 AI 비주얼 젠은 주로 캐시노트 앱 서비스에 활용할 수 있는 인물 캐릭터나 음식 등의 이미지를 생성한다. 기존 2D 이미지를 시각적으로 구현한 3D 형태가 특징이다. 예를 들어 “중년 여자 사장님이 꽃을 들고 있는 이미지를 만들어줘”라고 입력하는 방식이다. 캐릭터의 성별과 연령대는 물론 표정이나 앞치마 색깔 등 세부 요소도 추가로 수정할 수 있다. 한국신용데이터가 시중에 나온 생성형 AI를 활용하는 대신 자체 개발을 선택한 이유는 경제성과 효율성 때문이다. 기업이 생성형 AI를 전사적으로 도입하려면 상당한 라이선스 비용이 발생한다. 가령 50명이 서비스형소프트웨어(SaaS) 도구를 사용할 경우 고정 비용이 크게 늘어나지만, 애플리케이션프로그래밍인터페이스(API)를 활용해 자체 구축할 경우 약 95%의 비용 절감 효과를 기대할 수 있다는 설명이다. “범용 모델과 달리, 자체 구축 모델은 디자이너가 아니더라도 프롬프트 입력만으로 실무에 바로 사용할 수 있는 디자인 결과물을 생성할 수 있다. 특히 한국신용데이터만의 정체성이 담긴 이미지를 곧바로 만들어낼 수 있다는 것이 장점이다.” 기존에는 이미지를 하나 제작하기 위해 기획과 리뷰, 피드백 과정을 거쳐 최소 일주일 이상이 소요됐다. 한국신용데이터에는 그래픽 디자이너가 두 명뿐이라 여러 부서에서 이미지 제작 요청이 몰리면 병목 현상이 발생하기도 했다. 그러나 '캐시노트 AI 비주얼 젠'을 활용하면서 복잡한 제작 과정을 거치지 않고 서비스나 광고 배너 등에 활용할 이미지를 약 1분 만에 만들 수 있게 됐다. 이지스 디자이너는 개발 과정에서 동료 개발자의 도움을 받았다. 바이브 코딩 방식으로 다양한 생성형 AI의 API를 활용했다. 그 중에서도 성능과 가격 측면에서 가장 합리적인 GPT-4o를 중심으로 활용하고 있다. “처음 개발에 도전하는 데다 참고할 레퍼런스도 거의 없어 쉽지 않았다. 우리 서비스의 고유 비주얼이 가진 형태적 특징, 컬러 값, 정서적 분위기, 표현 방식 등 디자이너의 감각적인 영역을 기계가 이해할 수 있는 명확한 언어와 수치로 '번역'하는 과정이 가장 중요하면서도 어려운 과제였다. 다행히 회사 동료들이 적극적으로 도와줘 실제 서비스로 실험적인 구현까지 완주할 수 있었다.” 한국신용데이터는 '캐시노트 AI 비주얼 젠'을 점차 고도화할 계획이다. 가령 기획을 입력하면 이에 최적화된 이미지를 자동으로 생성하고 추천하는 방향으로 확장할 예정이다. 나아가 해당 이미지를 접한 사용자의 행동, 구매 전환율, 클릭률 등의 데이터를 기반으로 추천 기능까지 구현한다면 사업 효율성을 높일 수 있을 것으로 기대하고 있다.

2026.03.15 09:15홍하나 기자

컬리, 이미지 생성 서비스 'AI 스튜디오' 출시

리테일 테크 기업 컬리는 인공지능(AI) 이미지 생성 서비스 'AI 스튜디오'를 출시했다고 20일 밝혔다. AI스튜디오는 구글의 생성형 AI만을 활용해 구현됐다. AI 스튜디오는 사진을 업로드하면 ▲인형 ▲영화배우 ▲옛날 캠 ▲한복 등 다양한 테마의 프로필 사진을 만들어 주는 서비스로 컬리 앱에서 이용할 수 있다. AI 스튜디오는 지난 달 중순 ▲기획자 ▲엔지니어 ▲디자이너 ▲마케터 등 컬리 사내 구성원들이 사이드 프로젝트로 시작해 지난 12일 공개됐다. 컬리 고객에게는 AI스튜디오 이용권이 하루 한 장씩 주어진다. 이미지 생성 시 이용권이 차감되며, 친구에게 공유한 링크로 이미지가 생성되면 한 장 더 받을 수 있다. 컬리 AI 스튜디오는 공개 일주일만에 누적 7만여 건의 이미지 생성을 기록했다. 이외에도 그동안 컬리는 고객이 앱에서 즐길 수 있는 다양한 기능을 구현해왔다. 컬리 앱 하단 '라운지'에서는 나만의 컬리 라이프를 소개할 수 있다. 좋아하는 상품을 추천하는 '마이 컬리템'과 투표, 추천 등을 통해 다른 이용자들과 의견을 공유할 수 있는 '커뮤니티' 등이 대표적이다. 컬리는 지난해 하반기 컬리 앱과 연동할 수 있는 AI 식단 관리 앱 '루션'도 선보였다. 컬리 관계자는 “AI 스튜디오는 고객이 앱 내에서 쇼핑뿐 아니라 즐겁게 머물 수 있는 다양한 경험 제공을 고민하다 기획하게 됐다”며 “리테일 테크 기업으로서 앞으로도 AI 기술을 접목해 고객의 라이프스타일을 다양하게 만들 수 있는 시도를 이어갈 계획”이라고 말했다.

2026.01.20 10:06박서린 기자

바이트플러스 "AI, 이제 '사람' 아닌 'AI'가 통제"

바이트플러스가 이제는 사람이 인공지능(AI)을 컨트롤하는 시대가 아닌 'AI가 AI를 컨트롤 하는 시대'가 될 것이란 전망을 내놨다. 이미나 바이트플러스 솔루션즈 아키텍트는 11일 서울 중구 신라호텔에서 열린 'ACC 2025'에서 "이것이 바이트플러스가 제안하는 자동화의 미래"라며 "자사 생성형 AI 솔루션은 단순히 콘텐츠를 만드는 것이 아니라 스스로 검증하고 분석하고 지휘한다"고 강조했다.'ACC 2025'는 지디넷코리아가 주관, 주최하고 과학기술정보통신부, 바이트플러스, 네이버 등이 후원하는 행사다. 먼저 이 솔루션즈 아키텍트는 생성형 AI를 활용한 콘텐츠 제작이 여전히 어려운 이유로 프롬프트 작성의 어려움, 수동 반복 생성, 파편화된 워크 플로우, 일관성의 부재, 부족한 제어 가능성, 수동 후반 작업을 꼽았다. 그는 이같은 문제를 해결하기 위한 방법으로 자사 크리에이티브 에이전트를 제시했다. 바이트플러스의 크리에이티브 에이전트는 AI 에이전트가 초거대 언어모델(LLM) 뿐만 아니라 이미지 생성 모델, 영상 생성 모델, 디지털 휴먼, 3D 모델에 이르기까지 수많은 생성형 AI 솔루션을 통합 지휘하는 것이 특징이다. 이 솔루션즈 아키텍트는 "크리에이티브 에이전트는 생성형 AI 솔루션 뿐만 아니라 기타 솔루션까지 모두 통합 지휘해 고품질 콘텐츠를 순식간에 만들어 주는 멀티모달 자동화 파이프라인"이라고 설명했다. 크리에이티브 에이전트를 구현하는 데는 바이트플러스의 이미지 생성 모델 '씨드림(seedream)' 4.5, 영상 생성 모델 '씨댄스(seedance)' 1.0, 디지털 휴먼 모델 '옴니휴먼(omnihuman) 1.0'이 필요하다. 그는 바이트플러스의 크리에이티브 에이전트의 장점으로 낮은 비용과 빠른 제작속도, 일관성 등을 들었다. 이 솔루션즈 아키텍트는 "비용은 극적으로 낮아지고 또 제작 속도는 혁신적으로 올라간다"며 "이 모든 콘텐츠는 압도적인 일관성을 가지게 되고 누구나 고품질 콘텐츠를 만들 수 있어 (콘텐츠) 제작 장벽 자체가 사라진다"고 말했다. 또 이 솔루션즈 아키텍트는 "더 이상 사람이 AI 컨트롤 하는 시대가 아니다"며 "AI가 AI를 컨트롤함으로써 복잡한 작업 과정을 완벽하게 자동화시킨다"고 마무리했다.

2025.12.11 14:48박서린 기자

머스크 xAI, '월드 모델' 개발 착수…AI가 직접 게임 만든다

일론 머스크가 이끄는 xAI가 물리적 공간을 인지하고 설계할 수 있는 차세대 인공지능(AI) '월드 모델' 개발에 나선다. 13일 파이낸셜타임스(FT)에 따르면 xAI는 텍스트 기반 언어모델을 넘어 영상·로봇 데이터를 학습한 AI 기술을 활용해 직접 만든 게임을 내년 공개할 계획이다. 월드 모델은 메타와 구글 등 주요 빅테크가 집중하는 차세대 AI 기술로, 물리적 공간을 이해하고 시뮬레이션하는 능력을 구현하는 것이 목표다. 앞서 xAI는 엔비디아 출신 전문가들을 다수 영입해 영상과 로봇 데이터를 기반으로 실제 환경을 학습하는 AI 모델 개발을 진행 중이다. 특히 이 기술을 활용해 상호작용 가능한 3D 게임 환경을 자동 생성하는 등 게임 산업 적용을 목표로 하고 있으며 향후 로봇 제어 시스템에도 응용할 계획이다. 일론 머스크 xAI 대표는 자사 SNS 플랫폼 X를 통해 "내년 말까지 AI가 직접 생성한 게임을 선보일 것"이라고 밝혔으며 최근 대규모 업그레이드를 거친 이미지·영상 생성 모델을 무료로 공개하기도 했다. 현재 오픈AI의 '소라'와 같은 영상 생성 AI는 학습 데이터를 기반으로 연속된 이미지 프레임을 예측하는 수준이다. 이에 반해 월드 모델은 물리 법칙과 사물 간 상호작용을 실시간으로 이해해 훨씬 높은 수준의 현실 시뮬레이션을 가능케 하는 것으로 알려졌다. xAI는 이미지·비디오 생성 엔지니어를 포함해 다양한 멀티모달 콘텐츠 제작 인력을 모집 중이다. 특히 자사 AI 챗봇 '그록'에게 게임 제작을 학습시키는 업무 담당자도 채용하고 있다. xAI를 비롯한 구글·메타 등이 월드 모델 개발에 집중하는 가운데, 업계에서는 실제 세계를 묘사할 데이터 확보와 막대한 비용 문제 해결을 주요 과제로 꼽고 있다. 라리안 스튜디오의 마이클 다우스 퍼블리싱 총괄은 "AI가 게임 산업의 가장 큰 문제인 리더십과 비전을 해결해 주진 못한다"며 "수학적으로 계산된 게임 루프보다 사람들이 진심으로 몰입하고 싶어 하는 세계를 표현하는 것이 더 중요하다"고 말했다.

2025.10.13 14:43한정호 기자

xAI, '월드 모델' AI 개발…엔비디아 출신 전문가 영입

인공지능(AI) 스타트업 xAI가 소위 '월드 모델'이라고 불리는 차세대 AI 시스템 개발 경쟁에 본격적으로 뛰어들었다. 이 기술은 경쟁사인 메타와 구글도 주력하고 분야로, AI가 물리적 환경을 탐색하고 설계할 수 있도록 하는 것을 목표로 하고 있다. 12일(현지시간) 파이낸셜타임스 등 외신에 따르면 xAI는 미국 반도체 기업 엔비디아 출신 전문가를 고용해 로봇과 영상 데이터로부터 현실 세계를 학습하는 차세대 AI 모델을 개발하기 시작했다. 엔비디아는 자사 옴니버스 플랫폼을 통해 시뮬레이션을 구축하고 실행하는 월드 모델 분야의 선도 기업이다. xAI가 개발에 착수한 월드 모델은 텍스트 기반의 대규모 언어모델(LLM)을 넘어서는 기술로 평가된다. 현재 오픈AI 챗GPT와 xAI 챗봇 그록과 같은 생성형 AI는 텍스트 데이터로만 훈련되지만, 월드 모델은 물리 법칙과 실제 환경 속 사물 간의 상호작용을 이해할 수 있는 AI를 개발하려는 시도로 해석된다. 사안에 정통한 관계자에 따르면 xAI는 월드 모델을 게임 분야에 우선 적용하는 것을 계획하고 있다. 이 기술은 AI가 직접 상호작용 가능한 3D 환경을 생성하는 데 사용될 수 있으며 이후에는 로봇용 AI 시스템에도 적용될 수 있다. 머스크 최고경영자(CEO)는 엑스(X)에서 “내년 말까지 AI가 만든 훌륭한 게임을 출시할 것”이라고 밝혔다. 월드 모델은 실시간으로 물리 법칙과 사물 간 인과 관계를 이해해 현실 세계 동작을 더욱 정확하게 시뮬레이션할 수 있다. xAI는 이미지 및 비디오 생성 기술 인력을 모집 중이며 이들이 합류할 '옴니 팀'은 텍스트를 넘어 이미지·영상·음성 등 다양한 형태의 콘텐츠를 이해하고 생성하는 팀이다. 구인하는 인력의 연봉은 18만~44만 달러(약 2억5천677만~6억2천766만원)에 달한다. 또 xAI는 '비디오 게임 튜터' 직책도 공개했는데, 이 역할은 그록이 AI 기반 게임을 제작하고 사용자가 AI와 함께 게임 디자인을 실험할 수 있도록 훈련시키는 것이다. 시급은 45~100달러 (6만4천200~14만2천650원) 수준이다.

2025.10.13 10:17박서린 기자

"독자 개발만으론 한계"…메타, 미드저니와 AI 동맹

페이스북 모회사 메타가 인공지능(AI) 이미지·영상 생성 스타트업 '미드저니' 기술 라이선스를 획득할 예정이다. AI 영역에서 독자 개발 중심 전략에서 벗어나 외부 파트너와 협력하는 방향으로 전환하며 경쟁력 강화에 나선다. 22일(현지시간) 파이낸셜타임즈 등 외신에 따르면 메타 신임 최고 AI 책임자인 알렉산드르 왕은 엑스(X)에 “향후 모델과 제품에 미드저니 미적 기술을 라이선스해 수십억명에게 아름다움을 제공할 것”이라고 양사 연구팀 간 기술적 협업을 예고했다. 이어 “자사가 사람들에게 최고의 제품을 제공하려면 모든 방식을 동원하는 접근이 필요하다”며 “이는 세계적인 수준 인재, 야심찬 컴퓨터 로드맵, 업계 최고 기업들과의 협력을 의미한다”고 덧붙였다. 미드저니는 2021년 데이비드 홀츠가 설립한 이미지 생성 기업으로 지난 6월에는 기존 이미지를 기반으로 짧은 영상을 생성할 수 있는 비디오 모델 'V1'을 선보였다. 이번 제휴를 통해 메타는 자사 앱에 멀티미디어 AI 생성 기능을 개발·통합할 수 있게 될 전망이다. 마크 저커버그 메타 최고경영자(CEO)는 플랫폼에서 AI 생성 콘텐츠가 점점 더 중요한 위치를 차지할 것이라고 언급한 바 있다. 메타의 이번 행보는 저커버그 CEO가 인간 지능을 뛰어넘는 '초지능' 개발에 수십억달러를 투입하는 과정에서 나온 것이다. 그는 최근 몇 달 간 경쟁사로부터 최고 수준의 AI 연구자를 적극적으로 영입했고 AI 인프라 투자도 대폭 늘렸다. 또한 AI 음성 기술 기업 플레이 AI를 인수하고 데이터 라벨링 기업 스케일 AI에도 지분을 투자했다. 아울러, 메타는 이번 주 자사 AI 조직을 재편한다고 발표했다. 메타의 AI 부서는 최근 메타 초지능 랩으로 이름이 변경됐으며 이번 개편으로 4개의 별도 팀으로 나뉘었다. 이는 지난 6개월 동안 네 번째 조직 개편에 해당한다. 메타와 미드저니의 협력은 메타의 기존 자체 AI 모델과 제품이 경쟁사에 밀리기 시작하면서 나온 것이다. 또 모든 것을 내부에서만 구축하려는 메타의 방식을 버리고 외부와 손잡는 전환점이다. 지난해 메타는 텍스트 프롬프트로 이미지를 생성하는 도구 '이매진'을 출시했다. 같은 해 10월에는 텍스트 프롬프트를 기반으로 영상을 생성, 편집할 수 있는 영화 생성 모델 '무비 젠'에 대한 연구 논문을 발표하며 이를 올해 인스타그램에 완전히 통합하겠다고 발표했다. 그러나 통합은 아직 이뤄지지 않았으며 이를 두고 업계 관계자들은 이미 해당 모델이 구글의 비오 3(Veo 3)나 오픈AI의 소라와 같은 최신 공개 모델과 비교해 구식으로 보인다고 평가하기도 했다. 이외에도 메타는 핵심 대형 언어 모델 비헤모스를 대외 공개하려던 계획도 접고 새로운 모델 구축에 집중하고 있는 것으로 알려졌다. 내부적으로는 코딩과 같은 업무에서 서드파티 모델을 사용하기 시작했다.

2025.08.24 09:25박서린 기자

KAIST-네이버AI랩, 창의성 강화한 AI 기술 개발..."뻔한 건 안그려"

KAIST(총장 이광형)는 김재철AI대학원 최재식 교수 연구팀이 네이버 AI 랩과 공동으로 추가 학습 없이 인공지능(AI) 생성 모델의 창의적 생성을 강화하는 기술을 개발했다고 19일 밝혔다. 이 기술은 '뻔한' 이미지는 절대 그리지 않는다. 텍스트 기반 이미지 생성 모델의 내부 특징 맵을 증폭해 창의적 생성을 강화하는 식이다. 연구팀은 모델 내부의 얕은 블록들이 창의적 생성에 중요한 역할을 한다는 것을 발견하고, 특징 맵을 주파수 영역으로 변환 후 높은 주파수 영역에 해당하는 부분의 값을 증폭했다. 이 결과 연구팀은 노이즈나 작게 조각난 색깔 패턴의 형태가 유발되는 것을 확인했다. 권다희 연구생(박사과정, 공동제1저자)은 "얕은 블록의 낮은 주파수 영역을 증폭했더니 창의적 생성이 강화됐다"고 설명했다. 연구팀은 또 생성 모델 내부 각 블록 별로 최적의 증폭 값을 자동으로 선택하는 알고리즘도 개발했다. 이 알고리즘은 사전 학습된 스테이블 디퓨전 모델의 내부 특징 맵을 적절히 증폭해 추가적인 분류 데이터나 학습 없이 창의적 생성을 강화한다. 한지연 연구생(박사과정, 공동제1저자)은 "SDXL-터보 모델에서 발생하는 모드 붕괴 문제를 완화, 이미지 다양성이 증가한 것을 확인했다"고 말했다. 최재식 교수(교신저자)는 "생성 모델을 새로 학습하거나 미세조정 학습하지 않고 생성 모델의 창의적인 생성을 강화하는 최초의 방법론ˮ이라며 "학습된 인공지능 생성 모델 내부에 잠재된 창의성을 특징 맵 조작을 통해 강화할 수 있게 됐다"고 덧붙였다. 최 교수는 또 “이번 연구는 기존 학습된 모델에서도 텍스트만으로 창의적 이미지를 손쉽게 생성할 수 있게 됐으며, 이를 통해 창의적인 상품 디자인 등 다양한 분야에서 새로운 영감을 제공하고, 인공지능 모델이 창의적 생태계에서 실질적으로 유용하게 활용될 수 있도록 기여할 것"으로 기대했다. 연구결과는 국제 학술지 `국제 컴퓨터 비전 및 패턴인식 학술대회(CVPR)'에서 지난 15일 발표됐다. 연구는 KAIST-네이버 초창의적 AI 연구센터, 과학기술정보통신부의 재원으로 수행됐다.

2025.06.19 11:37박희범 기자

피규어·지브리 프사 만들기?…"챗GPT 개인정보 유출 위험"

인공지능(AI) 챗봇 '챗GPT'로 유행 따라 사진을 피규어나 일본 지브리스튜디오 애니메이션처럼 만들다가는 개인정보를 털릴 수 있다고 미국 잡지 와이어드는 1일(현지시간) 보도했다. 운영사 오픈AI는 새로운 GPT-4o 기반 이미지 생성기로 챗GPT의 사진 편집, 텍스트 렌더링 기능을 키웠다고 와이어드는 평가했다. 챗GPT 무료 계정과 사진만 있으면 재미있고 쉽게 이미지를 만들 수 있다. 그러나 피규어나 지브리 같은 그림을 만들려면 오픈AI에 많은 정보를 넘겨야 한다고 와이어드는 지적했다. 오픈AI는 이 정보로 인공지능을 학습시킬 수 있다. 유럽 OPIT(Open Institute of Technology)의 톰 바즈다 사이버보안학과장는 “챗GPT에 사진을 올릴 때마다 메타데이터 덩어리를 넘겨주는 셈”이라며 “사진 촬영 시간, 촬영 장소의 (GPS) 좌표 등 그림 파일에 첨부된 정보가 포함된다”고 말했다. 메타데이터(Metadata)란 다른 정보를 나타내는 정보를 뜻한다. 오픈AI는 챗GPT에 접속하는 기기 정보도 모으는 것으로 알려졌다. 기기 유형, 운영 체제, 브라우저 버전, 고유 식별자 등이다. 바즈다 학과장은 “챗GPT는 대화하듯 작동하기에 입력한 내용, 요청한 그림 종류, 인터페이스와의 상호 작용 방식, 동작 빈도와 같은 행동 정보도 수집한다”며 “생성형 AI를 훈련하는 금광”이라고 표현했다. 얼굴만 그런 게 아니다. 위험 관리 회사 GRC인터내셔널그룹의 캠든 울븐 AI제품 마케팅 책임자는 “고해상도 사진을 올리면 피사체뿐 아니라 배경, 다른 사람, 방 안의 물건, 문서처럼 읽을 수 있는 모든 것을 오픈AI에 주는 격”이라고 설명했다. 오픈AI는 생성형 AI를 학습시키려고 개인정보를 적극적으로 수집하지 않으며 인터넷 공개 정보로 사용자 프로필을 구축하고 광고하거나 정보를 팔지 않는다고 와이어드에 밝혔다. 그러나 오픈AI의 개인정보 보호 정책에 따라 챗GPT로 올라온 이미지는 보관되고, 생성형 AI를 개선하는 데 쓰일 수 있다고 와이어드는 비판했다. 챗GPT에서 정보를 지킬 가장 효과적인 방법은 채팅 기록을 끄는 일이라고 와이어드는 소개했다. 파일에서 메타데이터를 지우고 올려도 좋다. 사진 편집 도구를 쓰면 된다. 바즈다 학과장은 “사용자는 민감한 개인정보를 챗GPT에 쓰지 말고 정보를 알 수 있는 배경이 있는 사진이나 단체 사진은 올리지 말아야 한다”며 “이렇게 하면 내 정보가 챗GPT 훈련에 쓰이지 않도록 할 수 있다”고 조언했다.

2025.05.03 07:48유혜진 기자

"글로벌 수준"...카카오, 멀티모달 언어모델 'Kanana-o' 성능 공개

카카오가 새로운 인공지능 모델을 통해 기술 경쟁력 강화를 이어간다. 카카오(대표 정신아)는 공식 테크블로그를 통해 통합 멀티모달 언어모델 'Kanana-o'와 오디오 언어모델 'Kanana-a'의 성능과 개발 후기를 1일 공개했다. 통합 멀티모달 언어모델인 Kanana-o는 텍스트와 음성, 이미지까지 다양한 형태의 정보를 동시에 이해하고 처리할 수 있는 모델이다. 텍스트, 음성, 이미지 중 어떠한 조합으로 질문을 입력하더라도 처리 가능하며, 상황에 맞는 텍스트나 자연스러운 음성으로 응답 가능한 구조로 설계됐다. 카카오는 '모델 병합' 기술을 기반으로 이미지 처리에 특화된 모델 'Kanana-v'와 오디오 이해 및 생성에 특화된 'Kanana-a' 모델을 통합, 단기간 내 효율적으로 Kanana-o를 개발했다. 통합 후에는 이미지, 오디오, 텍스트 데이터를 동시에 학습하는 '병합 학습'을 통해 시각과 청각 정보를 동시에 이해하고, 텍스트와 연결 지을 수 있도록 통합 훈련을 거쳤다. 이런 과정을 통해 기존 LLM 구조에서 이미지 이해 능력과 음성 인식과 합성, 감정 이해 등 고도화된 오디오 능력을 확장시킨 통합 멀티모달 언어모델이 구현됐다. Kanana-o는 음성 감정 인식 기술을 통해 사용자의 의도를 올바르게 해석하고, 상황에 맞는 적절한 반응과 답변을 제공해준다. 억양, 말투, 목소리 떨림 등 비언어적 신호를 분석하고, 대화 맥락에 맞는 감정적이고 자연스러운 음성의 응답을 생성하는 것이 특징이다. 대규모 한국어 데이터셋을 활용해 한국어의 특수한 발화 구조, 억양, 어미 변화 등을 정밀하게 반영하기도 했다. 특히 제주도, 경상도 등 지역 방언을 인식하고 이를 표준어로 변환해 자연스러운 음성을 생성할 수 있다. 지속적인 성능의 고도화를 위해 카카오는 현재 독자적인 한국어 음성 토크나이저(오디오 신호를 일정 단위로 작게 분해하는 도구) 개발을 진행 중이다. 스트리밍 방식의 음성합성 기술을 적용해 사용자가 긴 대기 시간 없이 응답을 제공하는 강점도 보유했다. 예를 들어, 이미지와 함께 "이 그림에 어울리는 동화를 만들어 줘"라고 입력하면, Kanana-o는 해당 음성을 이해하고 사용자의 억양과 감정 등을 분석해 자연스럽고 창의적인 이야기를 실시간으로 생성해 들려준다. Kanana-o는 한국어 및 영어 벤치마크에서 글로벌 최고 모델들과 유사 수준을 기록했으며, 한국어 벤치마크에서는 높은 우위를 보였다. 특히, 감정인식 능력에서는 한국어와 영어 모두에서 큰 격차를 기록하며, 감정까지 이해하고 소통할 수 있는 AI 모델의 가능성을 입증했다. 이미지와 음성을 통합적으로 이해해야 하는 '이미지-음성 QA(질의응답)' 태스크에서도 강력한 성능을 달성하며, 통합 멀티모달 언어모델로서의 글로벌 경쟁력을 확인했다. 카카오는 향후 Kanana-o를 통해 ▲다중 턴 대화 처리 ▲양방향 데이터 동시 송수신 기술 대응 능력 강화 ▲부적절한 응답 방지를 위한 안전성 확보 등을 목표로 연구 개발을 지속해 갈 계획이다. 이를 통해 다중 음성 대화 환경에서의 사용자 경험을 혁신하고, 실제 대화에 가까운 자연스러운 상호작용을 실현해가는 것이 목표다. 카카오 김병학 카나나 성과리더는 "카나나 모델은 복합적인 형태의 정보를 통합적으로 처리함으로써 기존의 텍스트 중심 AI를 넘어 사람처럼 보고 듣고 말하며 공감하는 AI로 진화하고 있다"며 "독자적인 멀티모달 기술을 바탕으로 자사의 인공지능 기술 경쟁력을 강화하는 한편, 지속적 연구 결과 공유를 통해 국내 AI 생태계 발전에 꾸준히 기여할 계획"이라고 말했다.

2025.05.01 10:13백봉삼 기자

"트래픽 폭주에 발목"…오픈AI, 신규 유저에 '소라' 영상 생성 제한

오픈AI가 자사 멀티모달 생성형 인공지능(AI) 영상 서비스 '소라(Sora)'의 영상 생성 기능을 일부 사용자에 한해 제한했다. 지브리풍 이미지 생성 기능이 화제를 모으며 사용자가 급증한 데 따른 후속 조치다. 1일 테크크런치에 따르면 오픈AI는 최근 소라 영상 생성 기능을 신규 계정에서 사용할 수 없도록 설정했다. 소라에 최초 로그인한 사용자에겐 이미지 생성 기능만 제공되며 영상은 차단된다. 이번 제한 조치는 지난주 소라에 새롭게 추가된 이미지 생성 기능이 공개된 이후 내려졌다. 해당 기능은 미야자키 하야오 감독의 '스튜디오 지브리' 스타일을 재현할 정도로 뛰어난 품질을 자랑하며 소셜미디어를 중심으로 폭발적인 반응을 이끌었다. 다만 예상치를 훌쩍 웃도는 사용자 유입으로 서버 과부하 문제가 불거졌다. 오픈AI는 이에 따라 트래픽 조절이 시급하다고 판단해 신규 계정 중심으로 영상 기능을 잠정 차단한 것으로 보인다. 영상 생성을 차단한 오픈AI의 공식 지원 페이지에는 "현재 트래픽이 급증해 신규 계정에 대해 영상 생성을 임시로 비활성화했다"는 공지가 게재됐다. 기존 사용자 계정은 여전히 영상 생성이 가능하다. 샘 알트먼 오픈AI 최고경영자(CEO)는 지난 주말 X(구 트위터)를 통해 "출시 이후 지금까지 수요를 따라잡지 못하고 있다"며 "서비스 유지를 위해 직원들이 야근과 주말 근무까지 하고 있다"고 밝힌 바 있다.

2025.04.01 12:17조이환 기자

[써보고서] 그림도 글도 한 번에…'챗GPT 이미지 생성기' 미래 바꾼다

"이번에 업데이트된 '챗GPT' 이미지 생성기를 확인해봤습니다. 단순히 기존 이미지를 조합하는 수준이 아니라 텍스트의 의미를 더 깊이 이해하고 새로운 스타일과 구성, 언어 표현까지 가능합니다. 한글도 꽤나 잘 표현되고 긴 문장도 잘 소화합니다. 이제 그림과 관련해 뭐가 안 될 거라고 말하기가 무서울 정도네요." 한 국내 인공지능(AI) 전문가는 30일 자신의 소셜미디어를 통해 '챗GPT 이미지 생성기(ChatGPT Image Generator)'의 최신 업데이트 버전을 이같이 평했다. 그만의 생각이 아니다. 실제로 소셜미디어 곳곳에서는 해당 서비스에 대해 수많은 유저들이 뜨겁게 반응하며 새로운 사용사례를 발굴하고 다양한 실험을 이어가고 있다. '챗GPT 이미지 생성기'는 오픈AI가 자사의 거대언어모델(LLM)인 '챗GPT'의 '4o' 버전에 통합한 이미지 생성 기능이다. 지난 25일 기존 '달리' 이미지 생성기에서 새롭게 업데이트된 이번 버전은 기존 대비 뛰어난 언어 이해력과 창의성을 기반으로 훨씬 자연스럽고 풍부한 이미지 생성이 가능해졌다는 평가를 받고 있다. 이번에 공개된 버전은 단순한 그림 제작을 넘어, 사실상 '무엇이든 가능한 수준'에 도달했다는 평가다. ▲텍스트와 그래픽 요소가 결합된 시각자료 제작 ▲기존 이미지의 특정 글자나 오브젝트만 정밀하게 수정하는 리터칭 ▲실사 이미지의 형태를 유지하면서 전혀 다른 테마로 재해석하는 작업까지 대부분 구현이 가능하다. "AI가 만든 인포그래픽"…그림뿐 아니라 '시각 설명'까지 완성 무엇보다 주목할 점은 '그림과 글자 조합'에 대한 처리 능력이다. 우리가 일상적으로 확인하고 처리하는 대부분의 시각 자료는 이미지와 텍스트의 조합으로 구성돼 있다. 이 생성기는 이제 그런 형태의 콘텐츠라면 어지간한 수준까지 대부분 구현할 수 있을 만큼 진화했다. 일례로 최근 기자가 국내 AI 기업인 S2W를 인터뷰한 기사를 준비하며 회사와 밀접히 연관된 개념인 '온톨로지'와 '지식그래프' 같은 개념을 시각적으로 설명할 삽화가 필요했던 사례가 있다. 이 개념들은 본질적으로 매우 추상적이어서 그림으로는 설명이 어려울 수 있다. 그런데 이번 이미지 생성기는 그런 우려를 뛰어넘었다. 기자가 두 개념을 상징하는 그림들을 그려달라고 콘셉트와 설명을 입력하자 개념을 직관적으로 시각화한 고품질 그래픽을 수십 초 만에 생성해냈다. 지식그래프는 '데이터 간의 관계'를 시각적으로 보여주는 구조이고 '온톨로지'는 그 안의 개념과 의미를 정의한 일종의 '표준 사전'이다. 생성된 그림은 이 개념들을 처음 접하는 사람도 쉽게 이해할 수 있을 만큼 명확하게 표현해 줬다. 발표자료나 기사 내 삽화로도 손색이 없을 정도의 직관적 간단함을 보여줬다. 여기에 활용도를 한층 끌어올린 요소는 바로 영어 텍스트 처리 능력이다. 과거 이미지 생성기들은 영어조차 정확히 표현하지 못하는 경우가 많았다. 'AI' 같은 단어는 무난했지만 '국가안보(National Security)'처럼 긴 단어의 경우 알파벳이 일부 누락되거나 다른 글자로 바뀌는 문제가 흔했다. 이번 업데이트 이후에는 영어 문장을 거의 완벽하게 반영해 이제 굳이 외주를 맡기지 않아도 될 정도로 안정적인 결과물을 얻을 수 있다. 이 강점은 인포그래픽 제작에서 빛을 발한다. 예를 들어 앞서 언급한 '지식그래프'와 '온톨로지' 개념을 영어 발표자료로 만드는 실험을 해보기 위해 기자는 '챗GPT'에게 "이 기사 내용을 바탕으로 1슬라이드짜리 인포그래픽을 만들 수 있게 개념을 정리해줘"라고 지시했다. 이에 '챗GPT'는 즉각 구체적인 구성안을 제시했고 "이 구성을 기반으로 텍스트나 디자인 워딩도 만들어줄 수 있다"며 "필요하면 파워포인트, 피그마, 웹용, 포스터 등 포맷에 맞춰 최적화도 가능하다"는 제안까지 곁들였다. 이에 기자는 '스타트업 감성'과 '노랑-하양' 계열 톤을 지정하며 포스터 형태로 직관적으로 이해 가능한 버전을 요청했다. 결과는 기대 이상이었다. 영어 문장 표현이 완벽하게 구현됐고 복잡한 개념도 깔끔하게 시각화됐다. 발표 자료로 바로 활용해도 손색이 없을 만큼의 완성도였고 제작에 걸린 시간은 1분 남짓이었다. 가정용 레이저 컬러 프린터에서 컬러 사진을 출력하는 속도다. 이미지 속 대사·표정·배경까지 자유자재…테마 전환도 '척척' 또 다른 주목할만한 특징은 '기존 이미지를 수정하는 기능'이다. 이제는 '챗GPT 4o'에 그림이나 사진을 입력한 뒤 그 안의 글자나 오브젝트를 일부 수정하는 것도 가능하다. 이는 더 이상 포토샵이나 전문적인 그래픽 디자인 툴 없이도 어느 정도의 시각적 편집 작업을 누구나 할 수 있게 됐다는 의미다. 일례로 기자는 인터넷에서 밈으로 유명한 김성모 화백의 만화 컷에서 등장인물의 대사인 "더이상의 자세한 설명은 생략한다"를 바꾸고 싶었다. '챗GPT'에게 이 이미지를 주고 "이 문장을 '자세한 설명이 필요하므로 다음 컷에 해주겠다'로 바꿔달라"고 요청하자 해당 문장을 깔끔하게 수정한 이미지를 바로 생성해줬다. 캐릭터의 외형은 약간의 차이가 있지만 전체적인 스타일은 거의 완벽하게 재현됐다. 공식 문서나 기획안 등 고해상도 일러스트가 필요한 상황이 아니라면 충분히 활용할 수 있을 정도다. 그림에 대한 소폭 수정도 자연스럽게 처리된다. 기자는 앞선 김성모 캐릭터에서 '목폴라를 벗기고 70년대식 콧수염을 붙여달라'고 요청했는데 역시 기대한 대로 처리됐다. 이외에도 캐릭터의 표정 변화, 옷이나 헤어스타일 교체, 배경 변경 등 다양한 시도가 가능했다. 다만 이 과정에서 한글 텍스트가 처음엔 조금 어색하게 표현되기도 했으나, 다시 "한글 자연스럽게 수정해줘"라고 요청하면 또 문제없이 보완해주는 구조다. 오브젝트의 테마나 분위기를 바꾸는 작업 역시 수준급이다. 최근 소셜미디어를 뜨겁게 달군 '지브리 테마 변환'이 대표적인 사례다. 최근에는 더 락, 백악관 보좌관 등 유명 인사, 인플루언서들이 이 기능을 이용해 카카오톡 프로필이나 SNS 프로필 사진을 새롭게 꾸미는 사례가 확산되고 있다. 이에 동참해 기자는 스스로의 사진을 입력한 뒤 "지브리 애니메이션 분위기로 바꿔달라"고 요청했고 실제로 스튜디오 지브리를 연상시키는 따뜻한 색감과 몽환적인 배경, 부드러운 일러스트 스타일이 적용된 결과물이 나왔다. 또 하나 흥미로운 점은 단순히 캐릭터 스타일을 바꾸는 것을 넘어 이미지의 '전체 테마' 자체를 완전히 변환할 수 있다는 것이다. 단순히 눈이나 옷차림만 바꾸는 수준이 아니라 사진이 지닌 분위기와 배경까지 포함한 '서사적 연출'이 가능해진 셈이다. 최근 오픈AI 아태지역 홍보 담당자인 제이크 윌친스키는 자신의 링크드인에 새로운 사용 사례를 공개했다. 그는 '챗GPT 이미지 생성기'에 "우리 집 강아지를 최대한 나쁜 남자(Bad*ss)처럼 만들어달라"고 요청했고 그 결과 선글라스, 초커, 가죽 재킷을 착용한 터프한 강아지 이미지가 생성됐다. 기존 반려동물의 귀여운 이미지를 완전히 뒤엎는 콘셉트 전환이 구현된 것이다. 기자도 유사한 시도를 했다. 반려견 사진을 입력한 뒤 "이 강아지를 런던 동부의 불량 청소년처럼 바꿔달라"고 프롬프트를 주자 결과물은 놀라웠다. 푸들이었던 강아지는 그대로 유지됐지만 배경은 그래피티가 가득한 동런던 거리로 바뀌었고 모자, 아디다스 재킷, 귀걸이 등 각종 아이템으로 꾸며져 있었다. 한마디로 '코크니 억양으로 밤거리에서 맥주를 흔들며 인사를 건넬 것 같은' 이미지가 완성된 셈이다. 여전히 존재하는 한계…그럼에도 우리 삶 '게임 체인저'로서 잠재력 보여 물론 모든 기능이 완벽하게 구현되는 것은 아니다. 특히 텍스트 표현에서는 일부 한계가 남아 있다. 영어는 대부분 정확하게 처리되지만 문장이 너무 길거나 단어가 복잡할 경우 일부 글자가 누락되는 경우가 종종 발생한다. 기사 한 편 수준의 긴 문장을 이미지에 삽입하는 고난도 작업은 아직 포토샵 등 전문 편집 도구가 더 유리할 수 있다. 한글은 그보다 제약이 크다. 짧은 문장은 비교적 잘 표현되지만 한 문단 이상만 되어도 오타나 띄어쓰기 오류가 생길 가능성이 높다. 수정 요청을 통해 보완은 가능하지만 '한 번에 완성형'을 기대하기는 아직 무리다. 이미지 리터칭 역시 100% 재현이라고 보긴 어렵다. 김성모 화백의 만화 대사를 바꾼 예처럼 스타일과 구도는 거의 흡사하지만 선의 굵기 같은 디테일은 다소 달랐다. 반려견 사례에서도 강아지의 특징은 대부분 반영됐지만 실물과 완벽히 일치하기보다는 유사한 개체의 특징이 혼합된 결과물이었다. 이는 생성형 AI 특유의 '확률적 생성 방식'에 기반한 한계로 기술적으로는 어쩔 수 없는 영역이기도 하다. 다만 이런 단점을 감안하더라도 '챗GPT 4o 이미지 생성기'는 충분히 '게임 체인저'로서의 자격을 갖췄다. 핵심은 글과 그림이라는 인간 커뮤니케이션의 두 축을 AI가 모두 다룰 수 있게 되었다는 점이다. 이미지 속 텍스트를 고치고 그래픽을 새로 생성하며 오브젝트를 주제나 맥락에 맞춰 자연스럽게 변환하는 기능은 산업 전반에 걸쳐 새로운 창작 흐름을 만들어낼 수 있다. 특히 주목할 지점은 이러한 기능이 단지 업무 효율화나 콘텐츠 제작 자동화에만 그치지 않는다는 점이다. 사람들이 일상 속 감정과 기억, 유머와 밈(meme), 일상의 장면들까지도 누구나 이미지로 기록하고 나아가 수십초만에 창작할 수 있는 시대가 열린 것이다. '생활형 창작'의 문턱이 급격히 낮아진 지금 생성형 AI는 이제 단순한 도구가 아니라 삶을 구성하는 도구로 자리매김할 가능성이 보인다. 다만 이 기능은 아직 무료 버전에서는 제공되지 않는다. '챗GPT 4o'의 이미지 생성 기능은 현재 월 20달러(한화 약 2만7000원)의 유료 플랜인 '챗GPT 플러스(Plus)'와 200달러(한화 약 27만원) 플랜인 '챗GPT 프로(Pro)' 구독자에게만 제공된다. 본격적인 대중화는 향후 무료 사용자에게도 기능이 개방되는 시점 이후가 될 전망이다. 샘 알트먼 오픈AI 최고경영자(CEO)는 "'GPT-4o 이미지 생성기'는 현재 유료 사용자에게만 제공된다"며 "향후에는 무료 사용자와 애플리케이션 프로그램 인터페이스(API) 사용자에게도 확장 적용될 예정"이라고 밝혔다.

2025.03.30 14:55조이환 기자

오픈AI 샘 알트먼 "이미지 생성 모델 인기에 서버 과부하"

오픈AI가 출시한 '챗GPT-4o 이미지 생성(ChatGPT-4o Image Generation) 모델'이 샘 알트먼 최고경영자(CEO)를 난감하게 할 정도로 폭발적인 인기를 얻고 있다. 28일 CNBC에 따르면 샘 알트먼 CEO는 X(옛 트위터) 게시물을 통해 "사용자들이 새로운 챗GPT의 이미지 생성을 좋아하는 것은 정말 즐겁지만 자사 GPU가 녹아내리고 있다"고 밝혔다. 오픈AI가 새로 선보인 이미지 생성 모델은 텍스트와 이미지를 모두 통합할 수 있는 멀티모달 AI 모델인 챗GPT-4o 기반 서비스로 유료 구독자들을 비롯한 무료 사용자들에게도 공개됐다. 샘 알트먼 CEO도 자신의 X 프로필 사진을 챗GPT 이미지 생성 모델로 제작한 일본 지브리 애니메이션 스타일의 캐릭터 이미지로 바꿔 주목받았다. 이후 챗GPT의 이미지 생성 모델을 이용해 제작한 이미지들이 다양한 소셜 미디어에서 빠르게 확산되며 큰 인기를 끌고 있는 상황이다. 이 때문에 오픈AI의 서버조차 과부하가 걸렸다. 이에 샘 알트먼 CEO는 당분간 이미지 생성에 드는 속도와 제작 가능한 이미지 개수를 제한하는 등의 대응조치를 취할 것이라고 설명했다. 이제 무료 사용자들이 생성할 수 있는 이미지 개수는 하루당 3장으로 제한된다. 또 오류 수정 작업도 진행한다. 샘 알트먼 CEO는 "챗GPT가 일부 이미지를 생성하지 못하고 있다"며 "가능한 한 빨리 수정할 것"이라고 말했다.

2025.03.28 15:25한정호

[유미's 픽] 오픈AI 新 무기 출격에 한숨 쉬는 美 기업, 주가 또 흔들릴까

'포토샵'으로 잘 알려진 미국 소프트웨어 기업 어도비가 오픈AI·구글·xAI 등 인공지능(AI) 기술을 앞세운 새로운 경쟁자들의 등장으로 위기에 몰렸다. 간단한 프롬프트 입력만으로 전문가 못지 않은 퀄리티의 이미지를 쉽게 만들 수 있는 서비스들이 속속 등장하면서 존재감이 점차 희미해지고 있다는 평가가 나온다. 26일 업계에 따르면 어도비의 최근 1년간 주가는 무려 19.98%나 하락해 오후 4시 45분 현재 403.64달러에 머무르고 있다. 한 때 주가가 597.75달러까지 치솟았으나 경쟁사들의 잇따른 등장과 함께 새로운 성장 동력으로 내세운 AI 비즈니스가 시장에서 큰 호응을 얻고 있지 못한 까닭이다. 앞서 어도비는 지난 2023년 오픈AI가 '챗GPT'를 출시한 직후 AI 사진 편집 시장에 진입하기 위해 '파이어플라이'를 출시했다. 이후 어도비 익스프레스를 비롯한 포토샵, 일러스트레이터, 어도비 스톡 등 크리에이티브 클라우드 앱들에 생성형 AI를 탑재했다. 특히 포토샵에는 '제너레이티브 필(Generative Fill)', 어도비 스톡에서는 '텍스트 투 이미지(Text-to-Image)', 일러스트레이터에는 '제너레이티브 리컬러(Generative Recolor)' 등 AI 기반 기능이 출시됐다. 올해 초에는 파이어플레이 비디오 티어 등 새로운 AI 기반 서비스를 발표해 주목 받았다. 이 서비스는 사용자가 제출한 텍스트나 이미지 기반으로 비디오부터 3D 그래픽, 2D 애니메이션을 생성한다. 이를 시장에 확산시키고자 어도비는 서비스 내 생성형 AI 일부 기능을 무료로 제공하는 등 승부수를 걸었다. 확장 기능이나 상업적 사용을 위해서만 유로 플랜을 서비스에 적용한 상태로, 사용자 기반이 넓어지면 서비스 유료 전환을 순차적으로 유도하려는 전략도 세웠다. 최근에는 AI 에이전트가 접목된 새로운 애플리케이션(앱)인 '브랜드 컨시어지'를 선보여 주목을 받았다. 기존 고객 데이터를 바탕으로 맞춤화된 콘텐츠 등을 추천하는 작업을 수행하는 것으로, 어도비가 AI 에이전트 제품을 선보인 것은 이번이 처음이다. 이 같은 어도비의 노력에도 불구하고 시장 내 반응은 뜨뜻미지근하다. 사용자들은 비용을 지불할 정도로 어도비의 AI 기능들이 가치가 있는지 불확실하다는 평가를 내놓고 있다. 경쟁사들의 기술력이 빠른 속도로 발전하고 있어서다. 실제 오픈소스로 제공되는 미드저니나 오픈AI의 '소라'는 텍스트와 사진 몇장 만으로도 AI 기반 이미지 콘텐츠 제작이 가능하도록 지원하고 있다. 해당 서비스 제공자들은 영상과 오디오, 사진 편집 기능까지 추가할 계획이라고 밝힌 상태다. 런웨이AI, 메타, 아마존 등도 잇따라 동영상 생성 AI 도구를 선보이며 어도비를 위협하고 있다. 이 같은 상황에서 오픈AI가 지난 25일 '챗GPT-4o 이미지 생성(ChatGPT-4o Image Generation) 모델'을 출시해 발등에 불이 떨어졌다. 맥락과 그리는 대상에 대한 이해도가 한층 더 높아져 이전보다 더 정확한 결과를 내놓을 수 있게 돼서다. 새 모델은 오픈AI의 시그니처 멀티모달 AI 모델인 챗GPT-4o와 결합한 이미지 생성 모델로, 텍스트와 이미지를 통합한 첫 모델이다. '그림'만 학습한 기존 이미지 모델에 GPT-4o 언어 모델이 결합하며 목적에 맞는 이미지를 쉽게 생성할 수 있게 됐다. 이 모델은 현재 유료 구독자들은 물론 무료 사용자들도 이용할 수 있다. 오픈AI는 기존에 '달리(DALL·E)'를 앞세워 이미지 생성 AI 시장에서 존재감을 키워왔다. 이를 사용했을 땐 숫자와 문자가 '그림'으로 해석돼 그려져 삐뚤게 이미지에서 표현됐지만, 새 모델은 언어 모델을 이해한 후 그림을 만들어 내 보다 정확한 결과물을 얻어낼 수 있다. '삼각형 바퀴를 가진 자전거'를 그려달라고 하면 기존 모델은 훈련되지 않은 데이터여서 결과물을 내놓는데 어려움을 겪었지만, 새 모델은 가능해졌다. 동영상 생성 AI인 '소라'에도 새 모델의 언어 이해가 적용돼 더 자연스러운 영상을 만들 수 있게 됐다. 이는 서비스 경쟁력 개선에 나선 오픈AI의 노력의 일환이다. 오픈AI 관계자는 "GPT-4o의 언어 지식과 이미지 지능이 결합된 모델"이라며 "기존 모델이 참신했다면 이 모델은 유용하다"고 설명했다. 오픈AI 외에도 구글은 제미나이에서 '이마젠' 이미지 생성 모델을 제공하고 있다. 중국 딥시크도 '야누스'라는 이름의 이미지 생성 모델을 출시했다. 동영상 생성 AI 시장에선 미드저니와 런웨이AI, 메타, 아마존 등도 잇따라 서비스를 선보이며 어도비를 위협하고 있다. RBC 애널리스트 매튜 스완슨은 "어도비가 생성형 AI 제품 로드맵을 잘 따라가고 있지만, 명확한 수익화 지표가 부족한 상태"라며 "투자자들이 어도비 진행 상황을 신뢰하기 어려운 상황"이라고 평가했다. 도이치뱅크 브래드 젤닉 애널리스트 역시 "어도비 경영진은 파이어플라이의 가능성을 강조하고 있지만, 아직 재무적 영향은 확인되지 않았다"고 지적했다. 조던 클라인 미즈호 애널리스트는 "어도비 플랫폼에서 점유율을 차지할 새로운 AI 기반 비디오 제작 엔진이 (투자자들에게) 우려 사항으로 남아 있다"며 "어도비는 소프트웨어 분야에서 가장 논쟁이 많은 주식 중 하나"라고 평가했다.

2025.03.26 17:21장유미 기자

구글이 자사 인공지능(AI) 이미지 생성·편집 기능을 대폭 강화했다. 멀티모달 처리와 향상된 추론 능력 덕분에 스토리텔링과 창작의 자유는 한층 넓어졌지만 저작권 침해와 콘텐츠 조작 가능성도 커져 우려를 낳고 있다. 17일 테크크런치에 따르면 구글은 최근 자사 '제미나이 플래시 2.0'의 네이티브 이미지 생성 기능을 공개하고 이를 두고 개발자들이 실험할 수 있도록 조치했다. 이번 업데이트는 구글이 실험용 AI들을 공개해 둔 웹사이트인 'AI 스튜디오'와 '제미나이' 애플리케이션 프로그램 인터페이스(API)를 통해 제공된다. 이번에 '플래시 2.0'에 추가된 이미지 생성 및 편집 기능은 텍스트와 이미지를 결합해 일관된 스토리를 생성하는 기능을 지원한다. 사용자가 원하는 스타일에 맞춰 스토리를 변경하거나 그림을 수정할 수도 있다. 대화형 이미지 편집 기능도 추가돼 자연어 명령만으로 이미지의 세부 요소를 조정할 수 있다. 이 모델은 단순한 이미지 생성 기능을 넘어 '세계에 대한 이해' 능력도 탑재했다. 텍스트 렌더링 성능도 개선돼 광고·초대장 제작 등에도 활용 가능할 것으로 보인다. 일례로 사용자는 자연어 프롬프트로 AI에 말을 그리라고 지시한 후 생성된 말의 모양과 외모는 유지하면서 색깔만 바꾸는 것이 가능해진다. 이외에도 캐릭터 일러스트를 삽입한 후 캐릭터가 입고 있는 옷을 바꾸거나 만화 컷에 나온 등장인물의 발언만을 다르게 바꾸는 것도 가능하다. 다만 이같은 AI의 강력한 이미지 편집 기능이 저작권 문제를 일으킬 가능성도 크다. 일부 사용자는 '플래시 2.0'을 이용해 이미지에 삽입된 워터마크를 제거하는 실험을 진행 중이다. 특히 게티이미지와 같은 스톡 이미지 기업의 콘텐츠 보호 장치가 AI에 의해 무력화될 가능성이 제기된다. 이전까지 오픈AI, 앤트로픽 등의 AI 모델들은 워터마크 제거 요청을 명확히 거부해왔다. 반대로 '플래시 2.0'은 별다른 제약 없이 워터마크를 삭제하고 그 자리를 자연스럽게 채우는 기능을 수행하는 것으로 알려졌다. 이러한 현상에 구글 측은 '플래시 2.0'이 아직 실험적 단계에 있으며 상업적 사용이 금지돼 있다고 밝혔다. 다만 AI의 기술적 한계를 실험할 목적으로 접근하는 사용자들이 많아 저작권 업계의 반발이 예상된다. 현재 미국 저작권법에 따르면 원 저작자의 동의 없이 워터마크를 삭제하는 행위는 불법이다. 일부 예외적인 경우를 제외하면 법적 조치가 가능하, 저작권 보호 기관들의 대응이 있을 것으로 보인다. 테크크런치는 "'플래시 2.0'은 유명인과 저작권이 있는 캐릭터의 이미지를 생성할 뿐만 아니라 기존 사진에서 워터마크를 제거하는 기능까지 수행하는 것으로 확인됐다."며 "일부 저작권 소유자들은 이 AI의 사용 제한이 느슨한 점에 대해 강하게 반발할 가능성이 크다"고 분석했다.

2025.03.17 14:53조이환 기자

Prev 1 Next

ZDNet 검색 페이지

'이미지 생성'통합검색 결과 입니다. (17건)

[기고] 인간이 직접 만든 콘텐츠입니다

글자만 번역하던 시대 끝…브랜드 감성까지 살리는 AI 뜬다

정체불명 이미지 AI '덕테이프'…나노바나나 대항마 될까

한국신용데이터 "직접 만든 AI모델, 이미지 제작 일주일→1분"

컬리, 이미지 생성 서비스 'AI 스튜디오' 출시

바이트플러스 "AI, 이제 '사람' 아닌 'AI'가 통제"

머스크 xAI, '월드 모델' 개발 착수…AI가 직접 게임 만든다

xAI, '월드 모델' AI 개발…엔비디아 출신 전문가 영입

"독자 개발만으론 한계"…메타, 미드저니와 AI 동맹

KAIST-네이버AI랩, 창의성 강화한 AI 기술 개발..."뻔한 건 안그려"

피규어·지브리 프사 만들기?…"챗GPT 개인정보 유출 위험"

"글로벌 수준"...카카오, 멀티모달 언어모델 'Kanana-o' 성능 공개

"트래픽 폭주에 발목"…오픈AI, 신규 유저에 '소라' 영상 생성 제한

[써보고서] 그림도 글도 한 번에…'챗GPT 이미지 생성기' 미래 바꾼다

오픈AI 샘 알트먼 "이미지 생성 모델 인기에 서버 과부하"

[유미's 픽] 오픈AI 新 무기 출격에 한숨 쉬는 美 기업, 주가 또 흔들릴까

"구글 AI, 워터마크 삭제까지"…'제미나이 플래시 2.0'에 저작권 업계 긴장

지금 뜨는 기사

이시각 헤드라인

젠슨 황, 방한 선물 공개…메모리 대규모 주문 시사

젠슨 황 '삼소회동'에 뜬 세븐일레븐·하이트진로...빙그레

기술은 모방돼도 권리는 남는다…자율주행 시장의 마지막 승부

스타벅스 불매 잦아드나…선물하기·결제액 엇갈린 신호

ZDNet Power Center