Comming Soon

LLM을 활용한 데이터 분석 [파이썬으로 익히는 멀티모달 분석 실전 가이드]

  • 원서명Data Analysis with LLMs (ISBN 978163343764)
  • 지은이이매뉴얼 트러머(Immanuel Trummer)
  • 옮긴이옥경석
  • 감수자티머시 앤드루 로버츠(Timothy Andrew Roberts)
  • ISBN : 9791175640009
  • 27,000원
  • 2026년 08월 17일 펴냄
  • 페이퍼백 | 284쪽 | 188*235mm
  • 시리즈 : 데이터 과학

책 소개

책 소개

LLM은 데이터 분석을 어떻게 바꾸는가
멀티모달 데이터, 이제 프롬프트로 분석한다

LLM을 활용하면 데이터 분석 작업을 더 빠르고 효율적으로 수행할 수 있다. 이 책에서 다루는 기법들을 익히고 나면, 자연어 프롬프트와 단 몇 줄의 파이썬 코드만으로 텍스트는 물론, 테이블 및 그래프 데이터, 이미지, 동영상, 오디오까지 분석할 수 있게 된다.

이 책은 다양한 실전 프로젝트를 통해 OpenAI 파이썬 라이브러리, LangChain, LlamaIndex 등의 도구와 Anthropic, Cohere, Hugging Face가 제공하는 LLM을 다룬다. 이를 활용해 데이터를 쿼리하고 분석하며, 비용과 품질을 최적화하는 방법까지 익히게 된다.

출판사 서평

유튜브 100만 뷰 강의로 검증된 코넬대 교수의 명쾌한 설명력
프롬프트와 파이썬으로 구축하는 실전 데이터 분석 파이프라인

LLM의 등장은 데이터 분석의 흐름을 바꾸고 있다. 하지만 LLM을 분석 업무에 제대로 녹여내기란 쉽지 않다. 이 책은 자연어 프롬프트와 파이썬 코드로 실무에 바로 적용할 수 있는 분석 파이프라인 구축 방법을 구체적으로 제시한다.

이 책의 탁월함은 저자의 깊이 있는 전문성에서 나온다. 코넬대학교 컴퓨터과학과 부교수이자 코넬 데이터베이스 그룹을 이끄는 이매뉴얼 트러머가 직접 집필했다. 유튜브 누적 조회수 100만을 돌파한 그의 강의 노하우가 고스란히 담겨 있어, 학술적으로 검증된 기본기와 현장에 곧바로 적용할 수 있는 실용성을 동시에 제공한다.

단 284쪽이라는 부담 없는 분량이지만, 그 안에 담긴 내용의 밀도는 가볍지 않다. 텍스트 분석을 시작으로 테이블과 그래프 데이터, 나아가 이미지와 동영상, 오디오를 아우르는 멀티모달 분석으로 독자를 이끈다. LLM이 도구를 선택하고 분석을 수행하는 자율 에이전트 구축부터 비용과 품질 최적화까지 실무에서 마주하는 과제를 짚어준다.

흩어진 인터넷 자료만으로는 실전에 적용할 수 있는 분석 환경을 체계적으로 구축하기 어렵다. 프롬프트와 파이썬으로 나만의 데이터 분석 파이프라인을 구축하고 싶다면, 이 책이 가장 든든한 안내서가 될 것이다.

추천의 글

체계적이고 깊이 있으며, 실습까지 풍부하다. 꼭 읽어보길 권한다!”
— 오렌 에치오니(Oren Etzioni), 앨런인공지능연구소

“다른 책에서 가볍게 넘기는 영역까지 깊이 파고든다. 실력을 단숨에 끌어올려 줄 책이다.
— 앤드루 카(Andrew Carr), Cartwheel

“이 책과 함께라면 LLM은 어떤 데이터에서든 손쉽게 인사이트를 끌어내는 필수 도구가 된다.”
— 아디티야 파라메스와란(Aditya Parameswaran), UC 버클리

“LLM을 활용한 멀티모달 데이터 분석에 꼭 필요한 책이다.”
— 수밋 바타차리야(Sumit Bhattacharyya), TELUS Health

저자/역자 소개

지은이 소개

이매뉴얼 트러머Immanuel Trummer

코넬대학교 컴퓨터과학과 부교수로 재직 중이며, 데이터 분석과 머신러닝의 접점에서 연구하고 있다. 특히 LLM을 데이터 분석에 활용하는 연구에 주력하여 여러 차례 논문상을 수상했고, 산업계와도 활발히 협력하고 있다. 유튜브에 올린 강의 영상도 조회수 100만을 돌파했다.

평소에는 바이올린 연주와 뉴욕주 북부의 아름다운 자연 탐방을 즐기며, 가족과 함께하는 시간을 소중히 여긴다.

지은이의 말

처음으로 대규모 언어 모델을 사용해본 경험은 거의 마법과도 같았다. 나는 아직도 GPT-3와 나눈 첫 대화를 생생히 기억한다. 그때 비로소 컴퓨터가 나를 진짜로 이해하고, 무엇을 요청해도 적절히 반응하는 것처럼 느껴졌다. 실제로 텍스트 분석부터 코딩까지 다양한 작업을 시켜봤는데, 오로지 내 지시만으로도 그 과제들을 척척 해냈다. 그전까지는 신경망을 활용하려면 작업마다 대량의 훈련 데이터를 수작업으로 일일이 라벨링한 뒤 모델을 학습시켜야 했기에, 언어 모델은 완전히 새로운 가능성을 열어줬다.

나는 곧 언어 모델에 매료됐고, 그 후로 연구 생활의 상당 부분을 그 놀라운 능력을 활용하는 데 쏟아부었다. 특히 데이터 분석 분야에 몸담아온 만큼, 언어 모델을 데이터 분석의 관점에서 바라보는 것은 자연스러운 일이었다. 초기에는 텍스트 분석에만 활용할 수 있었지만, 이제는 이미지, 오디오, 동영상까지 분석할 수 있는 멀티모달(multimodal) 모델로 발전했다. 덕분에 언어 모델은 데이터 분석의 필수 도구로 자리잡았고, 자연어로 작성한 작업 지시와 몇 줄의 파이썬 코드만으로도 복잡한 분석 파이프라인을 구축할 수 있게 됐다.

많은 데이터 과학자와 실무자가 언어 모델만 잘 활용해도 큰 도움을 받을 수 있지만, 막상 시작하려면 쉽지 않을 수 있다. 나 역시 다양한 데이터 분석 작업에 언어 모델을 적용하려할 때마다 블로그와 온라인 튜토리얼에서 필요한 정보를 조각조각 모아야 했다. 이 책은 내가 그 여정을 시작할 때 곁에 두고싶었던 바로 그 책이다. 여러분에게도 유용하고 재미있는 책이 되길 바란다!

옮긴이 소개

옥경석

한국해양대학교를 졸업한 뒤 10여 년간 상선에서 근무했고, 한일 여객선의 선장을 지냈다. 선장 시절 경험한 항법 자동화 시스템을 계기로 해양 ICT 전문기업 KJ엔지니어링을 창업했으며, 자율운항선박 등 다수의 국가 연구 과제에 연구 책임자로 참여해왔다. 챗봇 개발과 빅데이터 분석을 거쳐 현재는 LLM 기반 시스템 구현에 주력하고 있다.

옮긴 책으로는 『AI 시대의 데이터 패러독스』와 『LangChain과 LangGraph로 만드는 LLM 애플리케이션 2/e』(이상 에이콘출판사, 2026)이 있다.

옮긴이의 말

바다 위에서 길을 찾던 시절, 항법 자동화 시스템은 내게 '사람 대신 판단하는 기계'로 다가왔다. 그때의 경험이 지금 내가 생성형 AI와 데이터 분석을 다루는 엔지니어이자 번역자가 된 출발점이었다. 바다 위에서 고민하던 항로와 안전 문제를, 이제는 데이터와 알고리즘, 언어 모델을 통해 다시 풀어볼 수 있는 시대가 된 셈이다.

이 책은 텍스트, 테이블, 그래프뿐만 아니라 이미지, 동영상, 오디오까지 아우르는 멀티모달 데이터 분석을 언어 모델의 관점에서 체계적으로 정리한 보기 드문 입문서다. 기존 통계나 머신러닝 기반의 데이터 분석에 익숙한 독자라면, "자연어와 몇 줄의 파이썬 코드만으로도 꽤 복잡한 분석 파이프라인을 만들 수 있다"는 발상이 처음에는 낯설게 느껴질 수도 있다. 하지만 각 장의 미니 프로젝트를 따라가다보면, 언어 모델을 기존 도구의 단순한 대체재가 아니라 데이터 분석의 새로운 인터페이스이자 동료 분석가로 바라보게 될 것이다.

번역 과정에서는 원서가 전달하는 기술적 맥락과 실습 흐름을 최대한 유지하면서도, 독자가 바로 코드와 프로젝트에 적용할 수 있도록 용어와 예시를 다듬는 데 중점을 두었다. 이 책이 단순한 기술서가 아니라, 독자 여러분이 자신의 데이터와 도메인 문제를 언어 모델과 함께 탐색해보는 계기가 되었으면 한다. 바다에서 새로운 항로를 개척하듯, 여러분의 현장에서 새로운 데이터 분석의 길을 여는 데 이 책이 작은 길잡이가 되기를 바란다.

목차

목차
  • 서문
  • 감사의 글
  • 지은이 소개
  • 옮긴이 소개
  • 옮긴이의 말
  • 이 책에 대해

  • 1부 언어 모델 소개

  • 1장 LLM을 활용한 데이터 분석
  • __1.1 언어 모델은 무엇을 할 수 있는가?
  • __1.2 이 책에서 배울 내용
  • __1.3 언어 모델 사용 방법
  • ____1.3.1 프롬프팅
  • ____1.3.2 프롬프트 예시
  • ____1.3.3 인터페이스
  • __1.4 언어 모델을 데이터 분석에 활용하기
  • ____1.4.1 언어 모델을 데이터에 직접 활용하기
  • ____1.4.2 외부 툴을 통한 데이터 분석
  • __1.5 비용 최소화
  • ____1.5.1 적합한 모델 선택
  • ____1.5.2 모델 최적화 설정
  • ____1.5.3 프롬프트 엔지니어링
  • __1.6 고급 소프트웨어 프레임워크와 에이전트

  • 2장 ChatGPT와 채팅
  • __2.1 웹 인터페이스 접속
  • __2.2 인터페이스 소개
  • __2.3 ChatGPT를 사용한 텍스트 처리
  • __2.4 ChatGPT를 사용한 테이블 처리
  • ____2.4.1 웹 인터페이스에서 테이블 처리
  • ____2.4.2 자체 플랫폼에서 표 데이터 처리하기

  • 2부 언어 모델을 활용한 데이터 분석

  • 3장 OpenAI 파이썬 라이브러리
  • __3.1 사전 준비 사항
  • __3.2 OpenAI의 파이썬 라이브러리 설치
  • __3.3 사용 가능한 모델 목록 조회
  • __3.4 채팅 완성
  • __3.5 모델 동작 커스터마이징
  • ____3.5.1 종료 조건 구성
  • ____3.5.2 출력 생성 구성
  • ____3.5.3 무작위성 구성
  • ____3.5.4 커스터마이제이션 예시
  • ____3.5.5 추가 매개변수

  • 4장 텍스트 데이터 분석
  • __4.1 준비 사항
  • __4.2 분류
  • ____4.2.1 개요
  • ____4.2.2 프롬프트 생성
  • ____4.2.3 모델 호출하기
  • ____4.2.4 종단 간 분류 코드
  • ____4.2.5 문서 분류
  • ____4.2.6 코드 실행 방법
  • ____4.2.7 다양한 변형 시도해 보기
  • __4.3 텍스트 추출
  • ____4.3.1 개요
  • ____4.3.2 프롬프트 생성
  • ____4.3.3 후처리
  • ____4.3.4 종단 간 추출 코드
  • ____4.3.5 직접 해 보기
  • __4.4 클러스터링
  • ____4.4.1 개요
  • ____4.4.2 임베딩 계산하기
  • ____4.4.3 벡터 클러스터링
  • ____4.4.4 텍스트 클러스터링을 위한 종단 간 코드
  • ____4.4.5 직접 해 보기
  • ____4.4.6 임베딩 벡터의 다른 활용 사례

  • 5장 구조화된 데이터 분석
  • __5.1 개요
  • __5.2 게임 판매 분석을 위한 자연어 쿼리 인터페이스
  • ____5.2.1 SQLite 데이터베이스 설정
  • ____5.2.2 SQL 기초
  • ____5.2.3 개요
  • ____5.2.4 text-to-SQL 변환을 위한 프롬프트 생성
  • ____5.2.5 완성된 코드
  • ____5.2.6 직접 해 보기
  • __5.3 일반적인 자연어 쿼리 인터페이스
  • ____5.3.1 쿼리 실행
  • ____5.3.2 데이터베이스 구조 추출
  • ____5.3.3 전체 코드
  • ____5.3.4 시험 운용
  • __5.4 그래프 데이터를 위한 자연어 쿼리 인터페이스
  • ____5.4.1 그래프 데이터란 무엇인가?
  • ____5.4.2 Neo4j 데이터베이스 설정
  • ____5.4.3 Cypher 쿼리 언어
  • ____5.4.4 질문을 Cypher 쿼리로 변환하기
  • ____5.4.5 프롬프트 생성하기
  • ____5.4.6 전체 코드
  • ____5.4.7 직접 해 보기

  • 6장 이미지와 동영상 분석
  • __6.1 설정
  • __6.2 이미지에 대한 질문 답변하기
  • ____6.2.1 멀티모달 입력 지정하기
  • ____6.2.2 코드 설명
  • ____6.2.3 직접 해 보기
  • __6.3 이미지에서 사람 태그하기
  • ____6.3.1 개요
  • ____6.3.2 로컬에 저장된 이미지 인코딩하기
  • ____6.3.3 로컬에 저장된 이미지를 OpenAI로 전송하기
  • ____6.3.4 종단 간 구현
  • ____6.3.5 직접 해 보기
  • __6.4 동영상 제목 생성하기
  • ____6.4.1 개요
  • ____6.4.2 동영상 프레임 인코딩
  • ____6.4.3 종단 간 구현
  • ____6.4.4 직접 해 보기

  • 7장 오디오 데이터 분석
  • __7.1 준비 작업
  • __7.2 오디오 파일 텍스트 전사
  • ____7.2.1 음성을 텍스트로 전사하기
  • ____7.2.2 종단 간 코드
  • ____7.2.3 직접 해 보기
  • __7.3 음성을 이용한 관계형 데이터 쿼리
  • ____7.3.1 기본 준비 사항
  • ____7.3.2 개요
  • ____7.3.3 오디오 녹음
  • ____7.3.4 종단 간 코드
  • ____7.3.5 시험 운용
  • __7.4 음성-음성 번역
  • ____7.4.1 개요
  • ____7.4.2 음성 생성하기
  • ____7.4.3 종단 간 코드
  • ____7.4.4 직접 해 보기

  • 3부 고급 주제

  • 8장 GPT 대안 모델
  • __8.1 Anthropic
  • ____8.1.1 Claude와 대화하기
  • ____8.1.2 파이썬 라이브러리
  • __8.2 Cohere
  • ____8.2.1 Command R+와 대화하기
  • ____8.2.2 파이썬 라이브러리
  • __8.3 Google
  • ____8.3.1 Gemini와 채팅하기
  • ____8.3.2 파이썬 라이브러리
  • __8.4 Hugging Face
  • ____8.4.1 웹 플랫폼
  • ____8.4.2 파이썬 라이브러리

  • 9장 비용과 품질 최적화
  • __9.1 예시 시나리오
  • __9.2 조정되지 않은 분류기
  • __9.3 모델 튜닝
  • __9.4 모델 선택
  • __9.5 프롬프트 엔지니어링
  • __9.6 Tunable 분류기
  • __9.7 파인튜닝
  • __9.8 훈련 데이터 생성하기
  • __9.9 파인튜닝 작업 시작하기
  • __9.10 파인튜닝된 모델 사용하기

  • 10장 소프트웨어 프레임워크
  • __10.1 LangChain
  • __10.2 LangChain을 이용한 리뷰 분류
  • ____10.2.1 개요
  • ____10.2.2 분류 체인의 생성
  • ____10.2.3 코드 완성
  • ____10.2.4 시도하기
  • __10.3 에이전트: 대형 언어 모델을 주도적으로 활용하기
  • __10.4 데이터 분석을 위한 에이전트 구축
  • ____10.4.1 개요
  • ____10.4.2 LangChain을 이용한 에이전트 생성
  • ____10.4.3 데이터 분석 에이전트의 전체 코드
  • ____10.4.4 직접 해 보기
  • __10.5 사용자 정의 툴 추가하기
  • ____10.5.1 통화 변환기
  • ____10.5.2 직접 실행해 보기
  • __10.6 LlamaIndex를 사용한 멀티모달 데이터 인덱싱
  • ____10.6.1 개요
  • ____10.6.2 LlamaIndex 설치
  • ____10.6.3 간단한 쿼리 응답 시스템 구현
  • ____10.6.4 직접 실행해 보기
  • __10.7 결론

  • 찾아보기

도서 오류 신고

도서 오류 신고

에이콘출판사에 관심을 가져 주셔서 고맙습니다. 도서의 오탈자 정보를 알려주시면 다음 개정판 인쇄 시 반영하겠습니다.

오탈자 정보는 다음과 같이 입력해 주시면 됩니다.

(예시) p.100 아래에서 3행 : '몇일'동안 -> 며칠동안