• ZDNet USA
  • ZDNet China
  • ZDNet Japan
  • English
  • 지디넷 웨비나
뉴스
  • 최신뉴스
  • 방송/통신
  • 컴퓨팅
  • 홈&모바일
  • 인터넷
  • 반도체/디스플레이
  • 카테크
  • 헬스케어
  • 게임
  • 중기&스타트업
  • 유통
  • 금융
  • 과학
  • 디지털경제
  • 취업/HR/교육
  • 생활/문화
  • 인사•부음
  • 글로벌뉴스
  • AI의 눈
ZDPick
인공지능
AI의 눈
IT'sight
칼럼•연재
포토•영상

ZDNet 검색 페이지

'이미지 AI'통합검색 결과 입니다. (62건)

  • 태그
    • 제목
    • 제목 + 내용
    • 작성자
    • 태그
  • 기간
    • 3개월
    • 1년
    • 1년 이전

멀티모달 AI '망각 현상' 외부저장법으로 해결했다…성능도 2배 개선

국내 연구진이 AI가 새로운 정보를 배우거나 기존 정보를 수정하면, 예전에 배운 지식까지 함께 잊어버리는 '치명적 망각' 문제를 원천적으로 해결했다. 지식 편집 성능도 2배이상 개선했다. 한국전자통신연구원(ETRI)은 임수종 언어지능연구실장 연구팀이 POSTECH(포항공대), 성균관대학교와 공동으로 '연속·복합 지식 편집 원천 기술(MemEIC)'을 개발했다고 24일 밝혔다. 이 기술은 지난해 미국 샌디에이고에서 열린 세계적인 인공지능 학술대회 '뉴립스(NeurIPS) 2025'에 채택, 공개됐다. 최근 챗GPT, 제미나이, 클로드 등 이미지와 텍스트를 동시에 이해하는 멀티모달 AI가 빠르게 확산되고 있다. 그러나 이들에는 맹점이 있다. AI가 새로운 정보를 배우거나 기존 정보를 수정하면, 예전에 배운 지식까지 함께 잊어버리는 '치명적 망각' 현상이 발생한다. 특히 시각 정보와 언어 정보를 동시에 수정해야 하는 경우 두 종류의 지식이 서로 섞이면서 AI가 제대로 이해하지 못해 복합적인 질문에 틀린 답을 내놓는 경우가 빈번하게 나타났다. 연구팀이 이 같은 문제를 해결할 지식 편집 AI 기술을 공개했다. 이 기술은 새로운 정보를 AI 내부가 아닌 외부 메모리(보조기억장치)에 저장한다. 필요할 때만 정보를 불러와 사용하기 때문에 기존 모델 안정성을 유지하면서도 새로운 정보를 유연하게 추가할 수 있다. 기존 방식에서는 AI 내부의 핵심 파라미터를 직접 수정해 지식을 바꾸는 방식이 주로 사용됐다. 이로 인해 지식을 수정하는 과정에서 기존에 저장된 정보까지 영향을 받을 수 있다는 한계가 있었다. 논문 주저자인 성진 언어지능연구실 연구원은 "사람의 뇌가 좌우로 나뉘어 서로 다른 역할을 하듯 AI도 지식을 나누어 저장하도록 만든 것"이라고 말했다. 성진 연구원은 상용화 관련 "메믹이 기존 기술 대비 우수한 성능을 나타내지만, 실사용을 위해선 정확도가 90% 정도는 되어야 한다고 본다"며 "올해 말 기술이전이 이루어질 것으로 예상한다"고 덧붙였다. 이미지 관련 시각 정보는 '시각 어댑터'에 저장하고, 텍스트 관련 언어 정보는 '언어 어댑터'에 각각 독립적으로 저장한다. AI가 이미지와 텍스트를 함께 이해해야 하는 복합적인 질문을 받으면 '지식 커넥터'가 두 정보를 문맥에 맞게 연결해 답을 만든다. 연구진은 기술 성능 확인을 위해 1,278개 항목으로 구성된 복합 지식 편집 벤치마크(CCKEB)를 구축하고, 수백 건의 지식을 순차적으로 편집하는 실험을 진행했다. 그 결과 이 기술은 복합 질문 정확도가 70% 수준으로 나타냈다. 이는 기존 기술들이 36~52% 수준이었던 것과 비교하면 두 배 이상 향상된 성능이다. 또한 새로운 지식을 추가한 뒤에도 기존 질문에 대한 답이 변하지 않아 응답 안정성이 유지되는 '지역성(Locality)' 보존 특성도 확인됐다. 임수종 언어지능연구실장은 “향후 산업 현장의 다양한 정보를 안정적으로 반영할 수 있도록 기술을 더욱 고도화할 것"이라고 덧붙였다.

2026.03.24 09:39박희범 기자

트웰브랩스, 게티이미지코리아에 영상 AI 검색 적용

트웰브랩스가 글로벌 스톡 플랫폼에 인공지능(AI) 영상 검색 기술을 제공했다. 트웰브랩스는 게티이미지코리아 게티이미지 뱅크에 영상 이해 AI 모델 '마렝고'를 공급했다고 23일 밝혔다. 이를 통해 약 10만 고객이 AI 기반 검색 기능을 활용할 수 있다. 이번 서비스는 기존 키워드 중심 검색에서 벗어나 영상 맥락과 의미를 이해하는 방식으로 전환된 것이 핵심이다. 이용자는 구체적인 문장 설명만으로 원하는 장면을 검색할 수 있다. 시스템은 시각 정보와 음성, 자막을 종합 분석해 결과를 제시한다. 그동안 게티이미지 등 스톡 미디어 플랫폼은 메타데이터와 태그 기반 검색에 의존했다. 콘텐츠는 급증했지만 검색 방식은 제한적이었고, 반복적인 필터링 작업이 필요했다. 이번 기술 도입으로 검색 구조 자체가 변화하며 제작 과정의 탐색 시간이 줄어들 것으로 예상된다. 마렝고는 영상 내 다양한 정보를 통합 분석하는 멀티모달 AI 모델이다. 단순 객체 인식을 넘어 장면 흐름과 의미를 이해하고 검색, 분류, 요약까지 수행할 수 있다. 글로벌 시장에서도 기술력을 인정받아 아마존웹서비스(AWS) 아마존 베드록에도 공급됐다. 트웰브랩스 이재성 대표는 "우리 영상 이해 AI 기술이 실제 서비스에 적용돼 사용자 가치를 창출하게 된 의미 있는 사례"라며 "앞으로도 미디어 산업에서 AI가 만들어내는 혁신적인 변화를 선도해 나가겠다"고 밝혔다.

2026.03.23 10:13김미정 기자

첫 투어 국가로 韓 낙점한 감마…AI로 데이터 시각화 지원

인공지능(AI) 콘텐츠 플랫폼 감마가 글로벌 사용자 투어 첫 국가로 한국을 점찍고 신규 디자인 서비스 '감마 이매진'을 포함해 다양한 신규 업데이트 서비스를 선보였다. 감마는 지난 17일 서울 강남구에서 미디어 라운드테이블을 열고 신규 업데이트 서비스를 소개했다. 감마는 프레젠테이션, 문서, 웹사이트, 소셜 게시물 등 비주얼 콘텐츠를 AI로 제작할 수 있는 글로벌 플랫폼이다. 사용자가 아이디어나 키워드를 입력하면 AI가 콘텐츠의 구조를 설계하고 시각 디자인까지 생성하는 것이 특징이다. 2020년 설립 이후 전 세계 약 1억 명의 사용자가 이용하고 있으며, 매일 약 100만 개의 콘텐츠가 제작되고 있다. 이번 업데이트는 역대 최대 규모로, 프레젠테이션·문서 제작 서비스에서 로고, 인포그래픽, 소셜 이미지 등 시각 콘텐츠까지 생성 가능한 비주얼 스토리텔링 플랫폼으로 영역을 확장했다. 감마 이매진은 로고, 인포그래픽, 다이어그램, 소셜 게시물 등을 AI로 구현하는 기능이다. 참고 이미지를 기반으로 특정 스타일을 반영할 수 있으며 여러 디자인 시안을 동시에 제공한다. 자연어 입력만으로 수정까지 가능해 별도의 디자인 프로그램이나 전문 인력 없이도 브랜드에 최적화된 결과물을 만들 수 있다고 회사 측은 설명했다. 이번 업데이트에서는 콘텐츠 재구성과 데이터 시각화를 지원하는 기능도 추가됐다. AI 네이티브 리믹스 템플릿은 기존에 만든 감마 콘텐츠나 템플릿을 기반으로 수정 사항을 입력하면 새로운 디자인을 자동으로 제작한다. 스마트 차트는 데이터를 입력하면 막대그래프, 산점도, 퍼널, 히트맵 등 다양한 형태의 시각 자료로 변환한다. 또한 자연어 입력만으로 로고, 마케팅 그래픽, 소설 이미지 등을 생성할 수 있는 AI 일러스트레이션 기능과 인포그래픽이나 다이어그램을 제작할 수 있는 AI 인포그래픽 기능도 제공한다. 생성된 결과물은 단독 이미지로 사용하거나 프레젠테이션과 문서에 바로 활용할 수 있다. 감마는 외부 업무 솔루션과의 연동도 확대했다. 챗GPT, 클로드, 메이크, 재피어(Zapier), 아틀라시안(Atlassian), 엔에잇엔(n8n), 슈퍼휴먼 고(Superhuman Go) 등 주요 AI 및 업무 솔루션과 연결돼 별도의 프로그램을 실행하지 않아도 기존 AI 어시스턴트나 업무 환경에서 바로 콘텐츠 제작이 가능하다. 그랜트 리 감마 대표는 "디자인 전문 지식 없이도 누구나 시각적으로 아이디어를 표현할 수 있도록 하는 것이 감마의 목표"라며 "감마 이매진을 통해 아이디어에서 결과물 도출까지의 시간을 줄이고 완성도를 높일 수 있을 것"이라고 말했다.

2026.03.18 08:30박서린 기자

한국신용데이터 "직접 만든 AI모델, 이미지 제작 일주일→1분"

한국신용데이터가 자체 이미지생성 인공지능(AI) 모델을 개발했다. 약 한 달 반 만에 만든 생성형 AI 모델인 '캐시노트 AI 비주얼 젠'은 기존 서비스처럼 원하는 프롬프트를 입력하면 약 1분 내외로 이미지를 뚝딱 만들어낸다. 단순히 필요한 이미지가 아니라 한국신용데이터의 브랜드 특성과 디자인 정체성이 반영돼 곧바로 업무에 활용할 수 있는 것이 기존 모델과의 차별점이자 특징이다. '캐시노트 AI 비주얼 젠' 개발을 이끈 인물은 이지스 브랜드 디자이너다. 그는 한국신용데이터가 만든 경영 관리 서비스 '캐시노트'의 브랜드 디자인과 자회사 5곳의 기업 브랜드를 맡고 있다. 이지스 한국신용데이터 브랜드 디자이너는 지난 11일 강남구 사무실에서 지디넷코리아와 진행한 인터뷰에서 '캐시노트 AI 비주얼 젠' 개발 과정을 소개했다. “다양한 소상공인들이 캐시노트 서비스를 이용하는 만큼 각 도메인의 특성을 포괄할 수 있는 지식재산권(IP)을 만들고자 했다. 한국신용데이터의 브랜드 특성, 디자인 톤앤매너, 컬러와 형태에 대한 규칙을 시스템화했다.” 캐시노트 AI 비주얼 젠은 주로 캐시노트 앱 서비스에 활용할 수 있는 인물 캐릭터나 음식 등의 이미지를 생성한다. 기존 2D 이미지를 시각적으로 구현한 3D 형태가 특징이다. 예를 들어 “중년 여자 사장님이 꽃을 들고 있는 이미지를 만들어줘”라고 입력하는 방식이다. 캐릭터의 성별과 연령대는 물론 표정이나 앞치마 색깔 등 세부 요소도 추가로 수정할 수 있다. 한국신용데이터가 시중에 나온 생성형 AI를 활용하는 대신 자체 개발을 선택한 이유는 경제성과 효율성 때문이다. 기업이 생성형 AI를 전사적으로 도입하려면 상당한 라이선스 비용이 발생한다. 가령 50명이 서비스형소프트웨어(SaaS) 도구를 사용할 경우 고정 비용이 크게 늘어나지만, 애플리케이션프로그래밍인터페이스(API)를 활용해 자체 구축할 경우 약 95%의 비용 절감 효과를 기대할 수 있다는 설명이다. “범용 모델과 달리, 자체 구축 모델은 디자이너가 아니더라도 프롬프트 입력만으로 실무에 바로 사용할 수 있는 디자인 결과물을 생성할 수 있다. 특히 한국신용데이터만의 정체성이 담긴 이미지를 곧바로 만들어낼 수 있다는 것이 장점이다.” 기존에는 이미지를 하나 제작하기 위해 기획과 리뷰, 피드백 과정을 거쳐 최소 일주일 이상이 소요됐다. 한국신용데이터에는 그래픽 디자이너가 두 명뿐이라 여러 부서에서 이미지 제작 요청이 몰리면 병목 현상이 발생하기도 했다. 그러나 '캐시노트 AI 비주얼 젠'을 활용하면서 복잡한 제작 과정을 거치지 않고 서비스나 광고 배너 등에 활용할 이미지를 약 1분 만에 만들 수 있게 됐다. 이지스 디자이너는 개발 과정에서 동료 개발자의 도움을 받았다. 바이브 코딩 방식으로 다양한 생성형 AI의 API를 활용했다. 그 중에서도 성능과 가격 측면에서 가장 합리적인 GPT-4o를 중심으로 활용하고 있다. “처음 개발에 도전하는 데다 참고할 레퍼런스도 거의 없어 쉽지 않았다. 우리 서비스의 고유 비주얼이 가진 형태적 특징, 컬러 값, 정서적 분위기, 표현 방식 등 디자이너의 감각적인 영역을 기계가 이해할 수 있는 명확한 언어와 수치로 '번역'하는 과정이 가장 중요하면서도 어려운 과제였다. 다행히 회사 동료들이 적극적으로 도와줘 실제 서비스로 실험적인 구현까지 완주할 수 있었다.” 한국신용데이터는 '캐시노트 AI 비주얼 젠'을 점차 고도화할 계획이다. 가령 기획을 입력하면 이에 최적화된 이미지를 자동으로 생성하고 추천하는 방향으로 확장할 예정이다. 나아가 해당 이미지를 접한 사용자의 행동, 구매 전환율, 클릭률 등의 데이터를 기반으로 추천 기능까지 구현한다면 사업 효율성을 높일 수 있을 것으로 기대하고 있다.

2026.03.15 09:15홍하나 기자

"AI와 대화하며 작업"…어도비, AI 이미지 편집 기능 발표

어도비가 포토샵·파이어플라이에 대화형 인공지능(AI) 편집 기능을 확대해 자동화 업무 수준을 높였다. 어도비는 포토샵 웹과 모바일용 'AI 어시스턴트' 공개 베타 버전, '파이어플라이 이미지 에디터'를 11일 발표했다. 이번 기능은 대화형 AI를 통해 복잡한 이미지 편집 작업을 보다 효율적으로 수행하도록 돕는다. 포토샵 AI 어시스턴트는 채팅 기반 인터페이스를 통해 사용자 편집 의도를 이해하고 작업을 자동으로 수행하거나 단계별로 안내한다. 배경 제거·변경, 색상 조정, 조명 보정 등 주요 편집 작업을 자동 적용할 수 있다. 사용자는 음성으로도 편집 요청을 할 수 있다. 이를 통해 이동 중 모바일 환경에서 간편하게 이미지 편집 작업을 수행할 수 있다. 포토샵 웹에서는 'AI 마크업' 기능이 공개 베타로 제공된다. 사용자가 이미지 특정 영역을 표시한 뒤 프롬프트를 입력하면 해당 영역에 원하는 요소를 생성하도록 제어할 수 있다. 예를 들어 이미지 위 특정 영역을 표시한 뒤 '꽃 추가' '산 추가' 같은 프롬프트를 입력하면 해당 위치에 맞춰 새로운 이미지를 생성할 수 있다. 어도비는 파이어플라이 이미지 에디터를 통해 생성형 이미지 편집 기능을 통합했다. AI 생성 이미지와 사용자가 업로드한 이미지를 동일한 편집 환경에서 수정할 수 있도록 설계됐다. 파이어플라이 이미지 에디터는 생성형 채우기, 생성형 제거, 생성형 확장, 생성형 업스케일 배경 제거 등 주요 AI 편집 기능을 제공한다. 사용자는 프롬프트 기반으로 이미지 요소 추가, 교체, 보정, 확장, 해상도 개선 작업을 수행할 수 있다. 파이어플라이는 어도비 파이어플라이 모델 외에도 외부 AI 모델을 선택해 사용할 수 있도록 지원한다. 구글 '나노 바나나 2'를 비롯한 오픈AI 이미지 생성 등 25개 이상 모델을 지원한다.

2026.03.11 12:56김미정 기자

신입구직자는 '삼성', 경력직은 'SK' 선호...왜?

이번 달 삼성과 SK 등 주요 대기업들의 상반기 채용이 본격화되는 가운데, 진학사 캐치가 Z세대가 바라본 삼성과 SK의 기업 이미지를 AI로 시각화해 눈길을 끌고 있다. 캐치는 대학생·취준생·직장인 1만986명을 대상으로 진행한 '상위 그룹사 이미지 및 인식 조사' 결과를 6일 발표했다. 이번 조사는 구직자들이 선택한 기업 이미지 키워드를 AI 모델 '제미나이'에 입력해 각 그룹사를 대표하는 시각 이미지를 생성하는 방식으로 진행됐다. 먼저 구직자가 인식하는 삼성의 1위 키워드는 '글로벌(57%)'이었다. 이어 ▲업무강도 높은(48%) ▲기술주도(45%)가 뒤를 이으며 글로벌 시장을 선도하는 기술 중심 기업이라는 이미지가 구직자들에게 각인된 것으로 분석된다. AI는 이를 세련된 오피스 룩을 입고 태블릿과 캔 음료를 들고 있는 도시적이고 전문적인 여성 이미지로 생성했다. 반면 SK의 경우 '확실한 보상(54%)'이 1위 키워드로 꼽혔다. 뒤이어 ▲업무강도 높은(44%) ▲기술주도(41%) 순으로 나타나며 체감도 높은 보상 시스템이 SK의 대표 이미지로 자리 잡은 것으로 분석된다. AI는 이를 따뜻한 색감의 옷을 입고 카페에서 스마트폰과 커피를 즐기는 편안한 인상의 남성 이미지로 생성했다. 조사 결과에서 눈길을 끄는 부분은 연차에 따른 선호도 차이였다. 신입 구직자의 과반수(56%)는 삼성을 택했지만, 이직을 준비하는 경력직 구직자들은 SK(57%)를 더 선호했다. 사회 초년생은 글로벌 위상과 네임밸류를 중시하는 경향이 강한 반면, 직장 경험이 쌓일수록 실질적인 보상과 성과 시스템을 중요하게 고려하는 것으로 분석된다. 진학사 캐치 김정현 본부장은 “설문 데이터를 넘어 AI 기술로 구직자들의 인식을 시각화해 보니 그룹사별 이미지가 더욱 선명하게 드러났다”며 “채용 시장에서도 일방적인 홍보가 아닌 데이터와 구직자 트렌드에 기반한 타깃 맞춤형 브랜딩이 필수적인 시대”라고 강조했다. 삼성전자와 SK하이닉스는 이달 상반기 채용을 통해 반도체 인재 확보에 나설 예정이다. 삼성전자를 비롯한 삼성디스플레이, 삼성전기, 삼성SDI 등 주요 삼성 계열사는 이달 중순 신입사원 공개 채용을 시작할 것으로 알려졌으며, SK하이닉스 역시 반도체 연구개발(R&D) 등 핵심 분야 중심의 신입 채용을 진행할 계획이다.

2026.03.06 08:54백봉삼 기자

최 고 마크애니 대표 "AI 콘텐츠 워터마크, 국제 규격 C2PA로 가야"

"인공지능(AI) 생성 콘텐츠의 투명성을 확보하기 위해 대한민국이 독자적인 기준을 세우기보다 국제 표준인 C2PA(콘텐츠 출처 및 진위 확인을 위한 연합)를 적극 수용해야 합니다. 국내만의 별도 표준은 자칫 글로벌 흐름에서 뒤처지는 '갈라파고스적 규제'가 될 수 있습니다." 최고 마크애니 대표는 25일 서울 서초구 드림플러스 강남에서 개최된 'AI 투명성 법·제도 세미나'에서 이같이 강조했다. AI 기본법 시행으로 워터마크 부착이 의무화된 가운데, 최 대표는 기술적 파편화를 막고 글로벌 상호운용성을 확보해야 한다고 강조했다. 구글 제미나이, 오픈AI 챗GPT 등 생성형 AI가 생성한 이미지나 영상에는 워터마크가 붙어 있다. 생성형 AI를 통해 생성한 콘텐츠임을 확인시키기 위해 조그맣게 로고를 표시한 것이다. 일종의 증명인 셈이다. 이런 워터마크는 여러 종류가 있다. 먼저 생성형 AI가 생성한 콘텐츠에 붙는 워터마크는 '가시성 워터마크'다. 가령 제미나이를 통해 이미지를 생성하면 반투명한 로고가 우측 하단에 붙는 식이다. 가시성 워터마크는 생성형 AI를 통해 생성한 콘텐츠임을 증명하는 흔적을 누구나 쉽게 지울 수 있다는 단점이 있다. 포토샵으로 워터마크 자체를 지워버릴 수도 있고, 이미지를 조금만 확대해 잘라내도 워터마크를 없앨 수 있다. 이런 한계를 극복한 워터마크가 '비가시성 워터마크'다. 위조가 불가능한 고유한 서명을 이미지나 영상에 보이지 않게 부여한 것이다. 최 대표는 "할리우드 영화를 보면 매 프레임마다 화면 전체에 모두 비가시성 워터마크가 적용돼 있다. 보이지 않기 때문에 워터마크가 없다고 느낄 수 있지만, 고유 ID가 포함돼 있다"며 "예를 들어 네이버 TV를 본다면 네이버 TV라는 서명(ID)이 박혀 있고, 이를 시청하는 사용자의 ID가 포함돼 있다"고 설명했다. C2PA는 어도비, 마이크로소프트, 구글 등이 주도해 만든 개방형 비가시성 워터마크 기술이자 국제 표준이다. 마크애니는 C2PA 기술을 통해 위조가 불가능한 서명을 콘텐츠에 부여해 무결성을 확보한다. 디지털 콘텐츠가 진짜인지 AI가 생성한 것인지 확인할 수 있는 보이지 않는 수단을 제공하고 있는 것이다. 최 대표는 AI 기본법에 한국만의 표준을 적용기 보다는 국제 표준 C2PA를 따르는 방향으로 나아가야 한다고 주장했다. 그는 "삼성전자도 C2PA 메타데이터를 채택하고 있다. 여러 업체들이 C2PA에 올라타야 하는 상황인데, 대한민국만의 기준을 만들면 국제 표준도 준수해야 하고 국내의 기준도 맞춰야 하는 등 혼선만 초래할 수 있다"며 "C2PA는 무료다. 누구나 쓸 수 있는 오픈소스 형태로 돼 있기 때문에 일부 기업에 이권 사업이 될 확률이 매우 적다. 오히려 한국만의 표준을 만들면 이권 사업이 되는 것처럼 비춰질 수 있다"고 우려했다. 최 대표는 "단지 마크애니는 오픈소스인 C2PA를 스타트업 등 사용자가 쓰기 쉬운 형태로 무료배포하고 있을 뿐"이라며 "AI 기본법 준수 과정에서 겪은 어려움을 최소화하기 위해 지속적으로 지원하겠다"고 밝혔다.

2026.02.25 18:39김기찬 기자

컬리, 이미지 생성 서비스 'AI 스튜디오' 출시

리테일 테크 기업 컬리는 인공지능(AI) 이미지 생성 서비스 'AI 스튜디오'를 출시했다고 20일 밝혔다. AI스튜디오는 구글의 생성형 AI만을 활용해 구현됐다. AI 스튜디오는 사진을 업로드하면 ▲인형 ▲영화배우 ▲옛날 캠 ▲한복 등 다양한 테마의 프로필 사진을 만들어 주는 서비스로 컬리 앱에서 이용할 수 있다. AI 스튜디오는 지난 달 중순 ▲기획자 ▲엔지니어 ▲디자이너 ▲마케터 등 컬리 사내 구성원들이 사이드 프로젝트로 시작해 지난 12일 공개됐다. 컬리 고객에게는 AI스튜디오 이용권이 하루 한 장씩 주어진다. 이미지 생성 시 이용권이 차감되며, 친구에게 공유한 링크로 이미지가 생성되면 한 장 더 받을 수 있다. 컬리 AI 스튜디오는 공개 일주일만에 누적 7만여 건의 이미지 생성을 기록했다. 이외에도 그동안 컬리는 고객이 앱에서 즐길 수 있는 다양한 기능을 구현해왔다. 컬리 앱 하단 '라운지'에서는 나만의 컬리 라이프를 소개할 수 있다. 좋아하는 상품을 추천하는 '마이 컬리템'과 투표, 추천 등을 통해 다른 이용자들과 의견을 공유할 수 있는 '커뮤니티' 등이 대표적이다. 컬리는 지난해 하반기 컬리 앱과 연동할 수 있는 AI 식단 관리 앱 '루션'도 선보였다. 컬리 관계자는 “AI 스튜디오는 고객이 앱 내에서 쇼핑뿐 아니라 즐겁게 머물 수 있는 다양한 경험 제공을 고민하다 기획하게 됐다”며 “리테일 테크 기업으로서 앞으로도 AI 기술을 접목해 고객의 라이프스타일을 다양하게 만들 수 있는 시도를 이어갈 계획”이라고 말했다.

2026.01.20 10:06박서린 기자

"큰 모델보다 쓰임새"…네이버클라우드, 옴니모달 AI 전략 승부수

네이버클라우드가 범용 대규모언어모델(LLM) 경쟁을 넘어 텍스트·이미지·음성·도구 활용을 하나의 모델로 통합하는 '옴니모달 인공지능(AI)' 전략을 전면에 내세웠다. 상대적으로 작은 모델부터 시작해 점진적으로 고도화하는 방식으로, 현실 환경을 이해하고 행동하는 AI 에이전트 구현을 목표로 차세대 파운데이션 모델 경쟁에서 기술적 차별화를 강조했다. 네이버클라우드는 30일 과학기술정보통신부와 정보통신산업진흥원(NIPA)이 서울 코엑스에서 개최한 '독자 AI 파운데이션 모델 1차 대국민 발표회'에서 옴니모달 기반 파운데이션 모델과 이를 적용한 다양한 AI 서비스를 공개했다. 이날 네이버클라우드는 옴니 파운데이션 모델 전략을 제시했다. 전시 부스에서는 텍스트·이미지·오디오 등 서로 다른 형태의 데이터를 단일 모델에서 처음부터 함께 학습하는 네이티브 옴니모달 구조의 '하이퍼클로바X 시드 8B 옴니'와 복합 추론 능력을 강화한 '하이퍼클로바X 시드 32B 씽크' 두 가지 모델을 공개했다. 8B급 옴니모델은 규모는 비교적 작지만 멀티모달 입력을 단일 모델 구조에서 처리할 수 있도록 설계된 것이 특징이다. 텍스트·이미지·음성을 각각 다른 모델로 처리해 결합하는 기존 방식과 달리, 처음부터 하나의 의미 공간에서 학습해 응답 속도와 효율성을 높였다. 네이버클라우드는 이 모델을 시작점으로 삼아 데이터 확장과 학습 고도화를 통해 단계적으로 스케일업할 계획이다. 함께 공개된 32B급 씽크 모델은 옴니모달 입력을 바탕으로 추론과 문제 해결에 초점을 맞췄다. 이미지 이해, 음성 대화, 도구 활용 능력을 결합해 복합적인 요청을 처리하는 에이전트형 AI 경험을 구현하며 수학 문제 풀이나 시각 정보 기반 추론 등 고난도 작업을 수행하는 시연이 이뤄졌다. 부스에서는 이들 모델을 적용한 다양한 체험형 서비스도 공개됐다. 이미지 촬영만으로 문제를 이해하고 풀이 과정을 설명하는 AI 수학 에이전트, 민원 행정 상담을 돕는 AI 아바타, 법률 상담 챗봇, 감정 상담을 지원하는 마음 케어 아바타 등 공공·생활 밀착형 서비스가 관람객의 이목을 끌었다. 네이버클라우드는 이번 독자 AI 파운데이션 모델 프로젝트를 통해 대규모 파라미터 경쟁보다는 작은 모델을 촘촘하게 다져 키운다는 전략이다. 실제 서비스 환경에서 비용과 개발 부담을 줄이기 위해 8B·32B급 모델에서 옴니모달 구조와 추론 성능을 충분히 검증한 뒤 단계적으로 모델 규모를 확대하겠다는 구상이다. 이를 바탕으로 산업 및 공공 영역으로의 확장도 염두에 두고 있다. 네이버클라우드는 농기계와 모빌리티 등 다양한 산업 현장에서 음성·시각·공간 정보를 동시에 이해하는 AI 에이전트 활용 가능성을 제시하며 물리적 환경과 상호작용하는 피지컬 AI로의 진화를 준비 중이라고 설명했다. 네이버클라우드 관계자는 "옴니모달 AI는 단순히 모델을 크게 만드는 문제가 아니라, 현실 세계의 맥락을 얼마나 정교하게 이해하느냐가 핵심"이라며 "8B급 모델부터 차근차근 고도화해 나가며 산업과 일상에서 실제로 쓰이는 옴니 AI 에이전트를 구현해 나가겠다"고 말했다.

2025.12.30 14:40한정호 기자

인포뱅크, AI 오케스트레이션 '오르카' 출시…기업 시장 공략 가속

인포뱅크가 30년간 축적해 온 자체 개발 역량을 기반으로 기업 커뮤니케이션을 넘어 인공지능(AI)·데이터 중심 솔루션 영역으로 사업을 확장한다. 인포뱅크는 자사 AI 협업 플랫폼 '인세븐'에 자체 개발한 AI 오케스트레이션 시스템 '오르카'를 정식 출시했다고 22일 밝혔다. 최근 엔비디아를 비롯한 글로벌 기업들은 '툴오케스트라' 개념을 제시하며 다중 AI 모델 활용을 차세대 핵심 기술 방향으로 제안하고 있다. 그러나 실제 기업 현장에서는 업무별로 서로 다른 AI 모델을 개별 구독해야 하는 구조로 인해 비용 부담과 운영 복잡성이 커지는 상황이다. 이러한 비효율이 AI 전환(AX)을 가로막는 주요 장애 요인으로 지적돼왔다. 이번에 공개된 오르카는 다양한 글로벌 대규모언어모델(LLM)을 자동으로 선택·조합해 업무 상황에 가장 적합한 모델을 실시간으로 적용하는 AI 오케스트레이터로, 다중 모델을 유기적으로 활용하는 글로벌 AI 기술 흐름에 대응해 개발됐다. 업무 목적과 질문 난이도를 분석해 최적의 AI 모델을 자동 라우팅함으로써, 기업이 모델 선택에 대한 부담 없이 성능과 비용을 동시에 최적화할 수 있도록 지원한다. 이번 시스템은 실무 활용 시나리오를 기준으로 총 4종의 라인업으로 구성됐다. ▲반복 업무와 검색·요약에 적합한 경량 모델 '오르카 라이트' ▲번역과 보고서 작성 등 범용 업무를 지원하는 '오르카 플러스' ▲고급 추론과 전략적 의사결정을 돕는 '오르카 프로' ▲개발·코딩 업무에 특화된 '오르카 코더' 등으로 구성돼 직무와 목적에 따라 유연한 활용이 가능하다. 인세븐은 오르카 라인업 내 고사양 모델을 기존 대비 약 10% 낮은 비용으로 제공한다. 자동 라우팅 기능과 비용 최적화 로직을 결합해 기업의 AI 모델 사용 비용을 구조적으로 절감하도록 설계됐다. 또 복수 모델을 개별 구독해야 했던 기존 방식과 달리 오르카 기반의 단일 인터페이스만으로 필요한 모델을 자동 활용할 수 있어 운영 효율성 향상도 돕는다. 아울러 인세븐은 구글 제미나이 기반 이미지 생성 모델 '나노 바나나'의 플래시·프로 버전도 새롭게 선보였다. 사용자는 텍스트 질의만으로 고속 이미지 생성은 물론 장면 재구성이나 기존 이미지 요소를 유지한 편집까지 즉시 수행할 수 있어 마케팅·디자인·기획 등 시각 중심 업무의 효율을 높일 수 있다. 특히 인세븐의 자연어 처리 기능과 결합해 텍스트 분석 결과를 이미지로 바로 구현하는 '텍스트-이미지 통합 워크플로우' 활용도 가능하다. 인세븐은 최신 글로벌 AI 모델을 신속하게 도입하고 산업별 요구에 맞춘 오케스트레이션과 딥리서치 기능을 지속 고도화할 예정이다. 이를 통해 제조·금융·유통·헬스케어 등 다양한 산업 군을 아우르는 기업용 AI 분석 생태계를 단계적으로 확장해 나갈 계획이다. 인포뱅크 강진범 최고기술책임자(CTO)는 "글로벌 AI 기업들이 다중 모델 오케스트레이션을 핵심 경쟁 기술로 제시하고 있는 가운데, 인세븐은 국내에서 가장 빠르게 독자적인 오케스트레이션 시스템을 구축했다"며 "오르카는 기업이 모델 선택을 고민하지 않고도 최고 성능을 최소 비용으로 활용할 수 있게 해주는 출발점이 될 것"이라고 강조했다. 이어 "앞으로 직무별·산업별 특화 모델과 에이전트를 지속 고도화해 단순 답변 생성을 넘어 기업의 실질적인 디지털 전환을 가속화하는 AI 파트너로 자리매김할 것"이라고 덧붙였다.

2025.12.22 16:10한정호 기자

이미지 생성 AI 모델 경쟁 심화…오픈AI, 'GPT 이미지 1.5' 공개

오픈AI가 이미지 생성과 편집 성능을 강화한 새로운 모델을 선보이며 생성형 인공지능(AI) 이미지 시장 경쟁에 다시 불을 지폈다. 기존보다 정교한 지시 수행과 빠른 처리 속도를 앞세워 이미지 생성 도구를 실험 단계를 넘어 실사용 중심의 창작·업무 도구로 끌어올린다는 전략이다. 17일 테크크런치에 따르면 오픈AI는 새로운 이미지 생성 모델 'GPT 이미지 1.5'를 기반으로 한 챗GPT 이미지의 업데이트를 발표했다. 이번 모델은 지시 이행 정확도 향상, 세밀한 이미지 편집, 최대 4배 빠른 이미지 생성 속도가 특징으로, 모든 챗GPT 사용자에 순차적으로 제공된다. GPT 이미지 1.5는 오픈AI가 구글의 제미나이 시리즈와 이미지 생성 모델 경쟁을 본격화하는 과정과 맞물려 공개됐다. 구글이 최신 플래그십 모델과 이미지 생성기 '나노 바나나 프로'로 시장 점유율을 확대하는 가운데, 오픈AI가 이미지 모델 출시 시점을 앞당긴 것으로 풀이된다. 오픈AI의 이전 이미지 모델 출시는 지난 4월이었다. 이번 업데이트의 핵심은 반복 편집과 일관성이다. 기존 생성형 이미지 도구들이 특정 요소만 수정해 달라는 요청에도 이미지 전체를 다시 해석하는 한계가 있었던 반면, GPT 이미지 1.5는 얼굴 생김새, 조명, 구도, 색감 등 핵심 시각 요소를 유지한 채 요청한 부분만 정밀하게 수정할 수 있다. 이를 통해 실용적인 사진 보정은 물론 의상·헤어스타일 시뮬레이션, 원본 이미지를 유지한 스타일 변환 작업이 가능해졌다. 텍스트 렌더링 성능도 개선됐다. 작은 글자나 복잡한 텍스트 배치에서도 가독성이 높아졌으며 다수의 인물이 등장하는 이미지에서 얼굴 표현의 자연스러움도 향상됐다. 오픈AI는 이러한 개선을 통해 단순 이미지 생성뿐 아니라 마케팅·디자인·이커머스·커뮤니케이션 등 비즈니스 워크플로우 전반에서 활용도를 높일 수 있다고 설명했다. 사용자 경험 측면에서도 변화가 있다. 챗GPT 내부에 이미지 전용 공간이 새롭게 마련돼 모바일 앱과 웹 사이드바에서 접근할 수 있다. 사전 설정된 필터와 트렌드 기반 프롬프트를 활용해 보다 직관적인 이미지 탐색과 반복 시도가 가능해졌다. 오픈AI는 이 공간을 '크리에이티브 스튜디오'에 가깝게 설계했다고 밝혔다 . 다만 오픈AI는 이번 업데이트가 의미 있는 진전이지만 완성 단계는 아니라고 평가했다. 다양한 테스트 사례에서 성능 개선이 확인됐으나, 여전히 반복적인 개선이 필요한 영역이 남아 있으며 향후 업데이트를 통해 품질을 지속적으로 끌어올릴 계획이다. 피지 시모 오픈AI 애플리케이션 부문 CEO는 "챗GPT 사용자의 생각과 그것을 현실로 구현하는 능력 사이의 거리를 계속 좁혀 나가겠다"고 강조했다.

2025.12.17 15:04한정호 기자

바이트플러스 "AI, 이제 '사람' 아닌 'AI'가 통제"

바이트플러스가 이제는 사람이 인공지능(AI)을 컨트롤하는 시대가 아닌 'AI가 AI를 컨트롤 하는 시대'가 될 것이란 전망을 내놨다. 이미나 바이트플러스 솔루션즈 아키텍트는 11일 서울 중구 신라호텔에서 열린 'ACC 2025'에서 "이것이 바이트플러스가 제안하는 자동화의 미래"라며 "자사 생성형 AI 솔루션은 단순히 콘텐츠를 만드는 것이 아니라 스스로 검증하고 분석하고 지휘한다"고 강조했다.'ACC 2025'는 지디넷코리아가 주관, 주최하고 과학기술정보통신부, 바이트플러스, 네이버 등이 후원하는 행사다. 먼저 이 솔루션즈 아키텍트는 생성형 AI를 활용한 콘텐츠 제작이 여전히 어려운 이유로 프롬프트 작성의 어려움, 수동 반복 생성, 파편화된 워크 플로우, 일관성의 부재, 부족한 제어 가능성, 수동 후반 작업을 꼽았다. 그는 이같은 문제를 해결하기 위한 방법으로 자사 크리에이티브 에이전트를 제시했다. 바이트플러스의 크리에이티브 에이전트는 AI 에이전트가 초거대 언어모델(LLM) 뿐만 아니라 이미지 생성 모델, 영상 생성 모델, 디지털 휴먼, 3D 모델에 이르기까지 수많은 생성형 AI 솔루션을 통합 지휘하는 것이 특징이다. 이 솔루션즈 아키텍트는 "크리에이티브 에이전트는 생성형 AI 솔루션 뿐만 아니라 기타 솔루션까지 모두 통합 지휘해 고품질 콘텐츠를 순식간에 만들어 주는 멀티모달 자동화 파이프라인"이라고 설명했다. 크리에이티브 에이전트를 구현하는 데는 바이트플러스의 이미지 생성 모델 '씨드림(seedream)' 4.5, 영상 생성 모델 '씨댄스(seedance)' 1.0, 디지털 휴먼 모델 '옴니휴먼(omnihuman) 1.0'이 필요하다. 그는 바이트플러스의 크리에이티브 에이전트의 장점으로 낮은 비용과 빠른 제작속도, 일관성 등을 들었다. 이 솔루션즈 아키텍트는 "비용은 극적으로 낮아지고 또 제작 속도는 혁신적으로 올라간다"며 "이 모든 콘텐츠는 압도적인 일관성을 가지게 되고 누구나 고품질 콘텐츠를 만들 수 있어 (콘텐츠) 제작 장벽 자체가 사라진다"고 말했다. 또 이 솔루션즈 아키텍트는 "더 이상 사람이 AI 컨트롤 하는 시대가 아니다"며 "AI가 AI를 컨트롤함으로써 복잡한 작업 과정을 완벽하게 자동화시킨다"고 마무리했다.

2025.12.11 14:48박서린 기자

"3개월 만에 기업가치 3배"…멀티모달 AI 열풍 주역 美 스타트업, 투자자도 반했다

최근 생성형 인공지능(AI)이 텍스트 기반 거대언어모델(LLM)을 넘어 이미지·영상·오디오·3D까지 아우르는 멀티모달로 빠르게 확장되면서 미국 AI 스타트업 팔(Fal)에 대한 투자자들의 관심이 급증하고 있다. 멀티모달 활용 시 기업들의 복잡한 운영 부담을 덜어준다는 점에서 향후 성장성이 높다고 평가 받고 있어서다. 10일 블룸버그통신에 따르면 팔은 최근 세쿼이아캐피털이 주도한 시리즈D 투자를 통해 1억4천만 달러(약 2천16억원) 규모의 신규 투자 유치에 성공했다. 올 들어 세 번째 시리즈 투자로, 이번 투자에는 안데르센 호로위츠, 엔비디아, 세일즈포스, 쇼피파이 등 기존 투자자들도 참여했다. 이번 투자로 팔의 기업가치는 45억 달러로 평가됐다. 올해 7월 1억2천500만 달러 규모의 시리즈C 투자를 받을 당시 평가액의 약 3배에 달한다. 이곳은 올해 10월에도 세콰이아캐피털 등을 통해 시리즈D 투자 전 '브릿지격'으로 약 2억5천만 달러의 자금을 조달 받는데 성공했다. 이는 회사가 조달한 1억4천만 달러와 기존 투자자들의 지분 매각을 합산한 금액이다. 2021년 설립된 팔은 이미지, 비디오, 오디오, 3D 등에 쓰이는 여러 AI 모델들을 개발자가 쉽게 쓰도록 '호스팅과 API(application Programming Interface), 추론 인프라'를 제공하는 기업이다. 코인베이스 머신러닝 리더 출신 버르카이 구르와 AWS 개발자였던 고르켐 유르트세벤이 세운 곳으로, 어도비, 쇼피파이, 캔바 등 굵직한 기업들을 고객으로 확보하는 데 성공하며 빠른 속도로 덩치를 키우고 있다. 실제 이곳의 올해 매출은 지난 10월 기준 2억 달러를 이미 돌파한 상태다. 팔의 클라우드 플랫폼은 600개 이상의 이미지, 오디오, 영상 생성 AI 모델을 제공한다는 점이 강점이다. 오픈AI의 소라2, 구글이 최근 출시한 나노 바나나 프로와 같은 대표 모델뿐 아니라 다수의 오픈소스 알고리즘도 포함돼 있다. 이 모든 기능은 단일 API를 통해 접근 가능하다는 점에서 개발자들의 진입 장벽을 확 낮췄다는 평가를 받는다. 또 팔은 사용자 정의 모델을 실시간으로 구동할 수 있는 팔 서버리스(fal Serverless) 서비스도 운영 중이다. 이는 수천 개의 그래픽처리장치(GPU) 클러스터를 거의 즉시 가동할 수 있는 확장성을 지원하며, 엔비디아 H200, H100과 같은 최신 GPU에 대한 고속 접근성과 모니터링 도구도 제공한다. 보다 전문적인 요구사항을 가진 기업을 위해서는 전용 GPU 자원을 제공하는 팔 컴퓨트(fal Compute)도 마련돼 있다.자체 모델 개발에도 적극 나서고 있다는 점도 매력 요소다. 팔은 최근 이미지 생성 모델 오라플로우 v0.3을 공개했는데, 속도 중심의 '플로우 매칭' 구조를 적용해 보다 빠른 추론 성능을 실현했다는 평가를 받았다. 이는 기존 확산 모델 기반 생성 AI보다 효율성을 높였다는 점에서 개발자와 연구자 모두의 관심을 받고 있다. 이 같은 분위기 속에 팔은 투자자들로부터 유례없는 관심을 받고 있다. 멀티모달 AI 모델을 실제 서비스에서 운영하려는 수요가 폭발적으로 늘어나면서 이를 안정적으로 처리할 수 있는 인프라 시장의 가치가 급격히 커지고 있기 때문이다. 이에 텍스트 생성에서 이미지·영상·오디오로 확장되는 AI 경쟁이 본격화되자, 자체 인프라 구축 대신 즉시 적용 가능한 플랫폼을 찾기 시작한 기업들이 팔을 대안으로 선택하고 있다는 분석이 나온다. 업계 관계자는 "생성형 AI를 실시간 서비스 수준으로 끌어올리기 위해서는 대규모 GPU 자원과 높은 수준의 최적화가 필요하다"며 "팔은 이를 전적으로 맡아 처리함으로써 기업이 겪는 기술적 장벽을 크게 낮췄다"고 설명했다. 이어 "그 결과 사용자는 다양한 AI 모델을 단순 API 호출만으로 활용할 수 있게 됐다"며 "고비용 인프라 투자 없이도 빠르게 AI 기반 서비스를 추가할 수 있게 됐다"고 덧붙였다. 이 같은 확장성과 효율성은 팔의 기업가치를 단기간에 끌어올린 요인으로 평가된다. 멀티모달 AI가 산업 전반에서 필수 기술로 자리잡는 가운데 더 많은 기업이 팔의 AI 생성 기능을 기본 요소로 채택할 것으로 평가되는 것도 한 몫 했다. 업계 관계자는 "팔에 대한 투자는 멀티모달 AI 전환을 둘러싼 '인프라 전쟁'의 전선을 보여주는 사례"라며 "투자자들이 텍스트 중심 LLM 이후의 시대를 준비하는 상황에서 팔이 앞으로 빅테크와 경쟁 스타트업들 사이에서 얼마나 경쟁력을 보여줄 수 있을지가 관건이 될 것"이라고 분석했다.

2025.12.10 18:03장유미 기자

온다, 호스피탈리티 특화 멀티모달 AI 모델 개발

호스피탈리티 AI 기업 온다(대표 오현석)가 자체 개발한 멀티모달 AI 모델을 허깅 페이스에 공개하며, 국내 숙박 산업에서 실증된 AI 기술력을 입증했다고 18일 밝혔다. 이번에 공개된 모델은 8천여 장의 자체 구축 객실 이미지 데이터셋과 한국어 특화 자연어처리 기술을 결합한 하이브리드 AI다. 서로 다른 공급사로부터 제공되는 객실 정보를 자동으로 표준화해 96.5%의 높은 정확도를 달성했다. 온라인여행플랫폼(OTA)을 비롯한 숙박 유통 플랫폼은 다수의 공급사로부터 동일 호텔의 객실 데이터를 수집하지만, 공급사마다 객실명 표기 방식이 상이해 심각한 데이터 불일치 문제가 발생한다. 온다 AI Lab은 이 문제를 해결하기 위해 비전 트랜스포머 기반의 이미지 분류 모델과 한국어 특화 언어모델을 결합한 하이브리드 아키텍처를 설계했다. 이미지 모델은 침실, 거실, 욕실 등 객실 구성요소를 자동 인식하도록 학습됐다. 텍스트 모델은 '디럭스', '오션뷰', '얼리체크인' 등 숙박 도메인의 특화 용어의 의미를 분석하여 객실 유사도를 정밀하게 측정한다. 또 두 모델의 출력값을 가중 융합해 최종 유사도 점수를 산출하는 앙상블 기법을 적용, 동일한 침대 이미지를 사용하나 뷰가 다른 객실처럼 단일 이미지나 텍스트로는 구분이 어려운 엣지 케이스에서도 높은 정확도를 유지했다. 온다는 AI의 한계를 인정하고, 신뢰도 기반 하이브리드 워크플로우를 구축했다. 모델이 산출한 각 예측 결과에 신뢰도 점수를 부여하고, 설정된 기준 점수 이하의 케이스는 숙박 도메인 전문가가 최종 검토하는 AI-전문가 협업 구조를 도입해 실무 환경에서의 안정성과 신뢰성을 동시에 확보했다. 오현석 온다 대표는 "AI 시대에 진짜 경쟁력은 모델 자체가 아니라 모델을 학습시킬 수 있는 양질의 도메인 데이터와 실무 적용 능력"이라며 "온다는 8년간 쌓아온 데이터와 호스피탈리티 산업에 대한 깊은 이해를 바탕으로, 실제로 작동하는 AI를 만들 수 있는 몇 안 되는 기업"이라고 말했다. 온다는 향후 이 기술을 확장해 객실 어메니티 자동 인식, 뷰 타입 분류, 이미지 품질 평가 등 다양한 AI 기반 자동화 솔루션을 상용화할 계획이다.

2025.11.18 16:18백봉삼 기자

퍼플렉시티, AI 검색에 게티 이미지 사용한다

인공지능(AI) 검색 전문업체 퍼플렉시티가 게티이미지의 사진을 사용할 수 있게 됐다. 퍼플렉시티가 세계 최대 사진·영상 콘텐츠업체인 게티이미지와 다년 저작권 계약을 체결했다고 로이터를 비롯한 주요 외신들이 31일(현지시간) 보도했다. 두 회사는 정확한 계약 규모와 시간은 공개하지 않았다. 게티는 API를 통해 퍼플렉시티에 사진을 제공할 예정이다. 퍼플렉시티는 검색에 사용된 사진에 저작자와 출처 링크를 함께 표시할 계획이다. 이번 계약은 AI업체를 상대로 한 저작권 소송이 끊이지 않고 있는 가운데 나온 것이라 관심을 끈다. 뉴욕타임스는 오픈AI를 상대로 저작권 침해 소송을 진행 중이며, 게티 역시 스태비러티AI를 이미지 무단 사용 혐의로 제소했다. 퍼플렉시티도 현재 니케이, 아사히신문을 비롯한 여러 업체로부터 저작권 침해 혐의로 제소된 상태다. 반면 타임, 슈피겔 등 일부 언론사들과는 매출 공유를 기반으로 하는 제휴 계약을 체결했다.

2025.11.01 10:18김익현 미디어연구소장

머스크 xAI, '월드 모델' 개발 착수…AI가 직접 게임 만든다

일론 머스크가 이끄는 xAI가 물리적 공간을 인지하고 설계할 수 있는 차세대 인공지능(AI) '월드 모델' 개발에 나선다. 13일 파이낸셜타임스(FT)에 따르면 xAI는 텍스트 기반 언어모델을 넘어 영상·로봇 데이터를 학습한 AI 기술을 활용해 직접 만든 게임을 내년 공개할 계획이다. 월드 모델은 메타와 구글 등 주요 빅테크가 집중하는 차세대 AI 기술로, 물리적 공간을 이해하고 시뮬레이션하는 능력을 구현하는 것이 목표다. 앞서 xAI는 엔비디아 출신 전문가들을 다수 영입해 영상과 로봇 데이터를 기반으로 실제 환경을 학습하는 AI 모델 개발을 진행 중이다. 특히 이 기술을 활용해 상호작용 가능한 3D 게임 환경을 자동 생성하는 등 게임 산업 적용을 목표로 하고 있으며 향후 로봇 제어 시스템에도 응용할 계획이다. 일론 머스크 xAI 대표는 자사 SNS 플랫폼 X를 통해 "내년 말까지 AI가 직접 생성한 게임을 선보일 것"이라고 밝혔으며 최근 대규모 업그레이드를 거친 이미지·영상 생성 모델을 무료로 공개하기도 했다. 현재 오픈AI의 '소라'와 같은 영상 생성 AI는 학습 데이터를 기반으로 연속된 이미지 프레임을 예측하는 수준이다. 이에 반해 월드 모델은 물리 법칙과 사물 간 상호작용을 실시간으로 이해해 훨씬 높은 수준의 현실 시뮬레이션을 가능케 하는 것으로 알려졌다. xAI는 이미지·비디오 생성 엔지니어를 포함해 다양한 멀티모달 콘텐츠 제작 인력을 모집 중이다. 특히 자사 AI 챗봇 '그록'에게 게임 제작을 학습시키는 업무 담당자도 채용하고 있다. xAI를 비롯한 구글·메타 등이 월드 모델 개발에 집중하는 가운데, 업계에서는 실제 세계를 묘사할 데이터 확보와 막대한 비용 문제 해결을 주요 과제로 꼽고 있다. 라리안 스튜디오의 마이클 다우스 퍼블리싱 총괄은 "AI가 게임 산업의 가장 큰 문제인 리더십과 비전을 해결해 주진 못한다"며 "수학적으로 계산된 게임 루프보다 사람들이 진심으로 몰입하고 싶어 하는 세계를 표현하는 것이 더 중요하다"고 말했다.

2025.10.13 14:43한정호 기자

xAI, '월드 모델' AI 개발…엔비디아 출신 전문가 영입

인공지능(AI) 스타트업 xAI가 소위 '월드 모델'이라고 불리는 차세대 AI 시스템 개발 경쟁에 본격적으로 뛰어들었다. 이 기술은 경쟁사인 메타와 구글도 주력하고 분야로, AI가 물리적 환경을 탐색하고 설계할 수 있도록 하는 것을 목표로 하고 있다. 12일(현지시간) 파이낸셜타임스 등 외신에 따르면 xAI는 미국 반도체 기업 엔비디아 출신 전문가를 고용해 로봇과 영상 데이터로부터 현실 세계를 학습하는 차세대 AI 모델을 개발하기 시작했다. 엔비디아는 자사 옴니버스 플랫폼을 통해 시뮬레이션을 구축하고 실행하는 월드 모델 분야의 선도 기업이다. xAI가 개발에 착수한 월드 모델은 텍스트 기반의 대규모 언어모델(LLM)을 넘어서는 기술로 평가된다. 현재 오픈AI 챗GPT와 xAI 챗봇 그록과 같은 생성형 AI는 텍스트 데이터로만 훈련되지만, 월드 모델은 물리 법칙과 실제 환경 속 사물 간의 상호작용을 이해할 수 있는 AI를 개발하려는 시도로 해석된다. 사안에 정통한 관계자에 따르면 xAI는 월드 모델을 게임 분야에 우선 적용하는 것을 계획하고 있다. 이 기술은 AI가 직접 상호작용 가능한 3D 환경을 생성하는 데 사용될 수 있으며 이후에는 로봇용 AI 시스템에도 적용될 수 있다. 머스크 최고경영자(CEO)는 엑스(X)에서 “내년 말까지 AI가 만든 훌륭한 게임을 출시할 것”이라고 밝혔다. 월드 모델은 실시간으로 물리 법칙과 사물 간 인과 관계를 이해해 현실 세계 동작을 더욱 정확하게 시뮬레이션할 수 있다. xAI는 이미지 및 비디오 생성 기술 인력을 모집 중이며 이들이 합류할 '옴니 팀'은 텍스트를 넘어 이미지·영상·음성 등 다양한 형태의 콘텐츠를 이해하고 생성하는 팀이다. 구인하는 인력의 연봉은 18만~44만 달러(약 2억5천677만~6억2천766만원)에 달한다. 또 xAI는 '비디오 게임 튜터' 직책도 공개했는데, 이 역할은 그록이 AI 기반 게임을 제작하고 사용자가 AI와 함께 게임 디자인을 실험할 수 있도록 훈련시키는 것이다. 시급은 45~100달러 (6만4천200~14만2천650원) 수준이다.

2025.10.13 10:17박서린 기자

"챗GPT 제쳐"…구글, '나노 바나나' 출시로 美 앱스토어 1위

구글이 '나노 바나나'로 알려진 이미지 생성 모델 '제미나이 2.5 플래시 이미지'를 제미나이 애플리케이션에 추가한 뒤 모바일 시장에서 성과를 거둔 것으로 나타났다. 17일 테크크런치 등 외신에 따르면 앱 인텔리전스 기업 앱피겨스는 이달 제미나이 글로벌 다운로드가 전월 대비 45% 증가한 1천260만 건을 기록했다고 밝혔다. 특히 제미나이는 미국 앱스토어에서 이달 12일 기준 오픈AI 챗GPT를 제치고 1위에 올랐다. 올해 1월 미국 앱스토어 3위가 최고 기록이었으나 이번 성과로 단숨에 글로벌 톱으로 도약한 것이다. 구글 플레이스토어에서도 이달 8일 미국 26위에서 2위까지 상승했다. 다만 구글의 자체 플랫폼인 안드로이드에서는 여전히 챗GPT가 1위다. 테크크런치는 이런 앱 인기가 소비자 지출 증가로 이어졌다고 분석했다. 올해 iOS에서 발생한 인앱 결제와 구독 매출, 앱 내 소비자 지출 630만 달러(약 868천만원) 중 160만 달러(약 22억540만원)가 8월에 집중됐다. 이는 1월 11만5천 달러 대비 1천291% 급증한 수치다. 이달도 8월 성과를 따라잡거나 넘어설 가능성이 높은 상황이다. 구글은 나노 바나나 모델 출시 후 신규 이용자 2천300만 명이 유입됐고 이들이 공유한 이미지는 5억 장을 넘어섰다고 발표했다. 이를 통해 복잡한 편집을 쉽고 실제처럼 구현할 수 있다는 호평이 이어지고 있다. 제미나이 앱은 올해 들어 1억370만 회 다운로드를 기록했으며 출시 이후 누적 다운로드는 1억8천540만 회에 달한다. 나노 바나나는 구글이 지난달 출시한 제미나이 2.5 플래시 이미지 가칭이다. 사용자가 동일한 캐릭터를 다른 배경이나 환경에 배치하고 여러 각도에서 보여줘도 외형적 특징을 그대로 보존할 수 있다. 이를 통해 일관된 브랜드 자산을 생성하거나 부동산 매물 카드, 통일된 직원 배지 같은 시각적 템플릿 제작이 가능하다. 조시 우드워드 구글 제미나이 및 구글 랩스 부사장은 "제미나이 등 앱의 급격한 성장세는 AI 앱 시장 전반에 영향을 주고 있다"고 개인 소셜미디어를 통해 밝혔다.

2025.09.17 09:54김미정 기자

AI 어디까지 가나..."사진이나 영상 흐려도 말끔하게 복원"

인공지능(AI)이 한없이 진화하고 있다. 이번엔 활영 사진이나 영상 등이 흐릿해도 말끔하게 복원하는 기술이 개발돼 관심을 끈다. KAIST는 바이오및뇌공학과 장무석 교수와 김재철AI대학원 예종철 교수 연구팀이 움직이는 산란 매질(신호복제 환경) 너머의 숨겨진 영상을 복원할 수 있는 '비디오 디퓨전 기반 영상 복원 기술을 세계 처음 개발했다고 31일 밝혔다. 이 기술은 시간상으로 변한 영상 이미지 환경을 통해 흐릿하거나 손상된 부분을 디퓨전 모델 같은 생성형 AI모델로 되살린다. 안개·연기·불투명 유리·피부 조직 등과 같은 산란매질 때문에 '무엇인가에 가려 흐릿하게 보이는' 이미지를 마치 가려진 유리 뒤를 들여다보듯 복원한다. 연구팀은 기존 인공지능 복원 기술이 훈련된 데이터 범위에서만 성능을 발휘하는 한계를 극복하기 위해, 광학 모델과 비디오 디퓨전 모델을 결합했다. 특히 시간에 따라 산란 환경이 변하는 경우(바람에 흔들리는 커튼 너머 풍경 등)에도 안정적으로 복원할 수 있도록 연속된 영상의 시간적 상관관계를 학습한 디퓨전 모델을 적용했다. 이로인해 다양한 거리·두께·잡음 조건에서도 기존 대비 월등히 뛰어난 복원이 가능하다는 것. 기존 최고 성능의 복원 모델을 뛰어넘는 결과를 얻었다. 권성태 연구원은 "별도의 추가 학습 없이도 안개 제거, 영상 화질 개선(고해상도 프레임 생성), 블라인드 디블러링(흐린 영상 선명화) 등 다양한 상황에서 영상을 복원할 수 있는 최적화 기법을 도입해, 범용 복원 프레임워크로 확장할 가능성을 입증했다"고 설명했다. 장무석 교수 및 예종철 교수는 "혈액이나 피부 속을 들여다보는 비침습적 의료 진단, 화재 현장 연기 속 인명 구조, 벽에서 반사된 빛으로 영상을 복원하는 비시선 영상, 안개 낀 도로에서의 안전 운전 보조, 불투명 유리나 플라스틱 내부의 산업 검사, 흐린 물속 시야 확보 등 일상과 산업 전반에 활용될 수 있을 것"으로 기대했다. 연구는 KAIST 바이오및뇌공학과 권태성·송국호 박사과정이 공동 제1 저자로 참여했다. 인공지능 국제 학술지 IEEE TPAMI에 지난 13일 게재됐다. 과학기술정보통신부 및 한국연구재단 우수신진 연구자 사업, 뇌선도연구센터사업, 삼성미래기술육성사업, AI 스타펠로우십으로부터 연구 지원을 받았다.

2025.08.31 12:00박희범 기자

베일 벗은 '나노 바나나'…구글, AI 이미지 시장 '참전'

구글이 여러 이미지에 걸쳐 동일한 인물을 구현하고 자연어 명령만으로 특정 부분을 수정하는 인공지능(AI) 이미지 모델을 선보였다. 기존 모델의 한계로 지적된 품질과 제어 기능을 대폭 개선해 개발자와 창작자에게 고도화된 도구를 제공할 수 있게 된 것이다. 27일 구글 공식 블로그에 따르면 이 회사는 신규 이미지 생성·편집 모델 '제미나이 2.5 플래시 이미지'를 공식 출시했다. 이 모델은 제미나이 응용 프로그램 인터페이스(API)와 구글 AI 스튜디오, 엔터프라이즈용 버텍스 AI를 통해 즉시 사용할 수 있다. 새 모델의 가장 큰 특징은 캐릭터 일관성 유지 기능이다. 사용자는 동일한 캐릭터를 다른 배경이나 환경에 배치하고 여러 각도에서 보여줘도 외형적 특징을 그대로 보존할 수 있다. 구글은 이를 활용해 일관된 브랜드 자산을 생성하거나 부동산 매물 카드, 통일된 직원 배지 같은 시각적 템플릿 제작도 가능하다고 설명했다. 간단한 텍스트 지시만으로 정교한 편집을 수행하는 능력도 갖췄다. 사진 배경을 흐리게 만들거나 옷에 묻은 얼룩을 지우고 특정 인물을 사진에서 삭제하는 작업이 가능하다. 피사체의 포즈를 바꾸거나 흑백 사진에 색을 입히는 등 기존 이미지 편집 도구에서 수 시간이 걸리던 작업을 몇 초 만에 끝낼 수 있다. 두 개 이상의 이미지를 자연스럽게 합치는 '다중 이미지 융합' 기능도 핵심이다. 특정 제품 이미지를 새로운 배경 장면에 넣거나 방 사진에 특정 질감 이미지를 적용해 인테리어를 바꾸는 식의 활용이 가능하다. 또 모델이 가진 방대한 현실 세계 지식을 바탕으로 손으로 그린 다이어그램을 이해하고 교육적 질문에 답하는 대화형 튜터로도 작동한다. 이 모델은 출시 전 '나노 바나나'라는 가칭으로 먼저 알려지며 온라인에서 폭발적인 화제를 모았다. 지난 14일경 이미지 편집 성능 비교 플랫폼 'LM 아레나'에 아무런 예고 없이 등장해 압도적인 성능으로 순식간에 입소문을 탔다. 당시 나노 바나나는 두 개의 AI 모델이 생성한 결과물 중 더 나은 것을 고르는 '배틀' 방식으로 무작위 배정됐음에도 "포토샵을 대체할 수 있다"는 극찬을 받았다. 특히 만화 캐릭터를 실사 피규어처럼 바꾸거나 인물의 얼굴과 분위기를 그대로 유지한 채 다른 구도를 연출하는 능력은 이용자들을 놀라게 했다. 업계 관계자는 "AI 시장의 무게중심이 텍스트에서 비주얼로 이동하는 상황"이라며 "이미지 분야에서 구글 등의 성과가 빠르게 쌓이면서 오픈AI의 선도적 위치가 약해질 가능성도 있다"고 밝혔다.

2025.08.27 16:43조이환 기자

  Prev 1 2 3 4 Next  

지금 뜨는 기사

이시각 헤드라인

트럼프는 '평화와 번영'·시진핑은 '인간 통제'…미중 정상 AI 시각차

아이폰18프로 먹통·강제 재부팅...애플, 내주 SW 업데이트

AI가 알려준 PC 문제 해결법, 믿고 실행해도 될까

X·EU 법정 다툼에…美, 과징금 취소 소송 참여 움직임

ZDNet Power Center

Connect with us

ZDNET Korea is operated by Money Today Group under license from Ziff Davis. Global family site >>    CNET.com | ZDNet.com
  • 회사소개
  • 광고문의
  • DB마케팅문의
  • 제휴문의
  • 개인정보취급방침
  • 이용약관
  • 청소년 보호정책
  • 회사명 : (주)메가뉴스
  • 제호 : 지디넷코리아
  • 등록번호 : 서울아00665
  • 등록연월일 : 2008년 9월 23일
  • 사업자 등록번호 : 220-8-44355
  • 주호 : 서울시 마포구 양화로111 지은빌딩 3층
  • 대표전화 : (02)330-0100
  • 발행인 : 김경묵
  • 편집인 : 김태진
  • 개인정보관리 책임자·청소년보호책입자 : 김익현
  • COPYRIGHT © ZDNETKOREA ALL RIGHTS RESERVED.