-
-
plotly로 바로쓰는 동적시각화 in R & 파이썬
-
Python으로 배우는 ‘퀀트를 위한 머신러닝’ 시리즈 - Part 4: 실제 사례 연구 – 신용 부도 예측
https://product.kyobobook.co.kr/detail/S000001952215 시계열 데이터 처리와 분석 in R - 교보문고복잡한 수학 공식 없이 코드 위주의 설명과 실제 데이터를 통해 배우는 시계열 데이터와 알고리즘! 20여 년간 우리나라의 교육통계 데이터를 다뤄온 저자가 꼼꼼하게 안내하는 시계열 데이터 입product.kyobobook.co.kr Introduction퀀트를 위한 머신러닝(Machine Learning for Quants) 시리즈 Part 4에 오신 것을 환영한다. Part 1~3에서는 주가 움직임을 예측하는 시계열(Time Series) 데이터에 초점을 맞췄다. 이제 특정 시점에서 여러 대상을 한꺼번에 분석하는 **횡단면 데이터(Cross-Sectional Data..
2026.09.16
-
Python으로 배우는 ‘퀀트를 위한 머신러닝’ 시리즈 - Part 3: 로지스틱 회귀와 분류를 활용한 시장 방향 예측
https://product.kyobobook.co.kr/detail/S000001952215 시계열 데이터 처리와 분석 in R - 교보문고복잡한 수학 공식 없이 코드 위주의 설명과 실제 데이터를 통해 배우는 시계열 데이터와 알고리즘! 20여 년간 우리나라의 교육통계 데이터를 다뤄온 저자가 꼼꼼하게 안내하는 시계열 데이터 입product.kyobobook.co.kr Introduction1부와 2부에서는 트레이딩을 회귀(Regression) 문제로 다루었다. 즉, 자산의 정확한 수익률 수치(예: “+1.2%” 또는 “-0.5%”)를 예측하려고 했다. 하지만 시장에는 많은 노이즈가 존재하기 때문에 가격 변동의 정확한 크기를 예측하는 것은 매우 어렵다.퀀트 투자자는 주가가 정확히 얼마나 움직일지까지 알 ..
2026.09.15
-
Python으로 배우는 ‘퀀트를 위한 머신러닝’ 시리즈 - Part 2: 정규화 기법 마스터하기: 리지(Ridge), 라소(Lasso), 엘라스틱넷(ElasticNet)
https://product.kyobobook.co.kr/detail/S000001952215 시계열 데이터 처리와 분석 in R - 교보문고복잡한 수학 공식 없이 코드 위주의 설명과 실제 데이터를 통해 배우는 시계열 데이터와 알고리즘! 20여 년간 우리나라의 교육통계 데이터를 다뤄온 저자가 꼼꼼하게 안내하는 시계열 데이터 입product.kyobobook.co.kr 소개지난 글에서는 주식 수익률을 예측하기 위한 선형 회귀 모델을 만들었다. 이 과정에서 한 가지 중요한 사실을 확인했다. 단순한 모델은 종종 과소적합(underfitting) 되어 신호를 제대로 포착하지 못하는 반면, 고차 다항식과 같은 복잡한 모델은 과적합(overfitting) 되어 데이터의 노이즈까지 학습해 버린다.금융 데이터는 본질적..
2026.09.13
-
Polars와 DuckDB가 데이터 엔지니어링의 새로운 최강 조합인 이유
https://product.kyobobook.co.kr/detail/S000220221456 LUVIT EPL과 유튜브 데이터로 배우는 DuckDB - 교보문고복잡한 데이터 분석 흐름을 더 단순하게 만드는 DuckDB 최근 주목받고 있는 DuckDB를 활용해 SQL 기반 데이터 분석과 실전 프로젝트를 학습할 수 있도록 구성한 입문서다. 기본 사용법부터 SQL 기초와product.kyobobook.co.krhttps://product.kyobobook.co.kr/detail/S000218938819 LUVIT 폴라스로 시작하는 데이터 분석 - 교보문고복잡한 분석을 더 빠르게, 더 간결하게 Pandas를 뛰어넘는 분석 도구 Polarsproduct.kyobobook.co.kr Polars와 DuckDB가..
2026.09.11
-
정규화(Normalisation)와 표준화(Standardisation)란 무엇인가?
https://product.kyobobook.co.kr/detail/S000001952215 시계열 데이터 처리와 분석 in R - 교보문고복잡한 수학 공식 없이 코드 위주의 설명과 실제 데이터를 통해 배우는 시계열 데이터와 알고리즘! 20여 년간 우리나라의 교육통계 데이터를 다뤄온 저자가 꼼꼼하게 안내하는 시계열 데이터 입product.kyobobook.co.kr 소개머신러닝 튜토리얼을 조금이라도 따라 해본 적이 있다면 다음과 같은 코드를 분명 한 번쯤 작성해봤을 것이다.from sklearn.preprocessing import MinMaxScaler, StandardScaler그러고 나서 이런 의문이 들었을 것이다. 둘 중 어떤 것을 사용해야 하고, 그 이유는 무엇일까?정규화(Normalisati..
2026.09.09
-
마이클 조던이 우연히 설명해 주는 왜도(Skewness)
https://product.kyobobook.co.kr/detail/S000001952215 시계열 데이터 처리와 분석 in R - 교보문고복잡한 수학 공식 없이 코드 위주의 설명과 실제 데이터를 통해 배우는 시계열 데이터와 알고리즘! 20여 년간 우리나라의 교육통계 데이터를 다뤄온 저자가 꼼꼼하게 안내하는 시계열 데이터 입product.kyobobook.co.kr 1980년대 중반, 노스캐롤라이나 대학교(University of North Carolina) 지리학과 졸업생의 평균 소득이 얼마인지 물었다면 오타가 아닌가 싶을 정도의 숫자를 듣게 되었을 것이다. 무려 10만 달러가 넘었다. 이 숫자는 너무나 컸기 때문에 신입생 모집 설명회는 물론, 저녁 식탁에서 어떤 전공을 선택하는 것이 더 가치 있는지..
2026.09.07
-
DuckDB DB 파일과 Parquet의 비교
https://product.kyobobook.co.kr/detail/S000220221456 LUVIT EPL과 유튜브 데이터로 배우는 DuckDB - 교보문고복잡한 데이터 분석 흐름을 더 단순하게 만드는 DuckDB 최근 주목받고 있는 DuckDB를 활용해 SQL 기반 데이터 분석과 실전 프로젝트를 학습할 수 있도록 구성한 입문서다. 기본 사용법부터 SQL 기초와product.kyobobook.co.kr 나는 매일 AWS에서 CSV 파일을 로컬 워크스테이션으로 가져온 뒤, 분석을 수행하기 위해 이를 Parquet 형식으로 변환한다. 그런 다음 뷰(view)를 만들어 모든 쿼리를 이 뷰를 대상으로 실행한다.그런데 이 모든 파일을 하나의 영구적인 DuckDB 데이터베이스 파일로 변환한다면 어떻게 될까?A..
2026.09.06
-
아무도 이야기하지 않는 Polars와 SQL의 차이점
“Polars vs 요즘 뜨는 SQL 엔진” 같은 글을 이미 여러 번 보았을 것이고, 이제는 그런 비교에 지쳤을지도 모른다. 걱정하지 않아도 된다. 이 글은 그런 이야기를 하려는 것이 아니다.여기서는 충분히 다뤄지지 않고 있는 Polars와 SQL의 몇 가지 차이점과 이러한 차이를 어떻게 다룰 수 있는지 살펴본다. 이러한 차이점을 이해하면 Polars와 SQL 사이를 자연스럽게 오갈 수 있으며, 어느 쪽에서도 잘 활용할 수 있는 범용적인 코드를 작성할 수 있다.멘탈 모델Polars에서는 데이터프레임을 각각 고유한 이름을 가진 열(column)들의 집합으로 생각하는 것이 가장 적절하다. 각 열의 모든 요소는 동일한 데이터 타입이어야 하며, 모든 열의 길이도 같아야 한다. 열 사이에는 특별한 결합 관계가 없..
2026.09.04
-
가설 검정 완벽 이해하기: p-값, 오류, 검정력을 위한 초보자 가이드
인간은 추론에 그다지 능숙하지 않다. 우리는 어떤 현상을 관찰하면 그로부터 정확한 결론을 이끌어낼 수 있다고 생각하지만, 실제로는 그렇지 않은 경우가 많다.이러한 한계를 보완하고 우리 주변의 세상을 더 잘 이해하기 위해, 실험을 수행하거나 마케팅 캠페인을 시작할 때는 데이터를 분석하고 그 결과를 바탕으로 의사결정을 내릴 수 있도록 통계학(statistics)을 활용해야 한다. 그리고 이를 위해 가장 먼저 해야 할 단계가 바로 가설 검정(hypothesis testing)이다.이 글에서는 가설 검정의 핵심 개념을 하나씩 살펴본다. 가설이란 무엇인지, 가설을 어떻게 검정하는지, 그리고 다소 어렵게 느껴지는 p-값(p-value)과 알파 수준(alpha level)이 실제로 무엇을 의미하는지 알아본다. 이 글..
2026.09.03
-
AWS의 DuckLabs 인수: DuckDB의 새로운 미래
소개2026년 8월 26일, 암스테르담의 DuckLabs / DuckDB 팀과 AWS는 Amazon이 DuckLabs를 인수하기 위한 최종 계약을 체결했다고 발표했습니다. 내용을 요약하면 다음과 같습니다.DuckDB를 만들고 DuckLabs를 공동 창업한 Hannes Mühleisen과 Mark Raasveldt는 AWS에 합류한 이후에도 팀을 이끌고 오픈소스 프로젝트의 기술적 방향을 계속 주도할 예정입니다. DuckDB 오픈소스 프로젝트 역시 DuckLabs 팀이 계속 주도하며, DuckDB를 관리하는 비영리 독립 재단인 Foundation 아래에서 오픈소스로 유지됩니다. 또한 현재와 마찬가지로 MIT 라이선스로 제공될 예정입니다(DuckLabs 블로그 참조). 이번 인수는 커뮤니티의 많은 사람에게 놀..
2026.09.02
-
2026년 실시간 분석을 위한 최고의 OLAP 데이터베이스
https://product.kyobobook.co.kr/detail/S000220221456 LUVIT EPL과 유튜브 데이터로 배우는 DuckDB - 교보문고복잡한 데이터 분석 흐름을 더 단순하게 만드는 DuckDB 최근 주목받고 있는 DuckDB를 활용해 SQL 기반 데이터 분석과 실전 프로젝트를 학습할 수 있도록 구성한 입문서다. 기본 사용법부터 SQL 기초와product.kyobobook.co.kr지난 10년간 데이터 엔지니어링을 지배했던 아키텍처가 무너지고 있다지난 10년 동안 데이터 엔지니어링의 표준 아키텍처는 명확했습니다. 애플리케이션은 트랜잭션 처리용 행 기반(Row Store) 데이터베이스를 사용하고, 분석을 위해서는 데이터를 야간 배치 작업으로 클라우드 데이터 웨어하우스로 옮기는 방식..
2026.07.20
-
CSV 분석의 새로운 시대, 모든 것을 바꾼 DuckDB
https://product.kyobobook.co.kr/detail/S000220221456 LUVIT EPL과 유튜브 데이터로 배우는 DuckDB - 교보문고복잡한 데이터 분석 흐름을 더 단순하게 만드는 DuckDB 최근 주목받고 있는 DuckDB를 활용해 SQL 기반 데이터 분석과 실전 프로젝트를 학습할 수 있도록 구성한 입문서다. 기본 사용법부터 SQL 기초와product.kyobobook.co.kr CSV 기반의 느린 분석 워크플로를 이제 그만 사용하세요. DuckDB가 CSV 처리를 어떻게 프로덕션 환경에서도 사용할 수 있는 수준의 고성능 분석으로 바꾸는지, 그리고 이를 가능하게 하는 최신 데이터 엔지니어링 패턴을 살펴보겠습니다. 데이터를 바라보는 방식을 완전히 바꿔 놓은 기술은 많지 않습니다..
2026.07.20
-
DuckDB와 Iceberg: 차세대 로컬 데이터 분석 환경
https://product.kyobobook.co.kr/detail/S000220221456 LUVIT EPL과 유튜브 데이터로 배우는 DuckDB | 이기준 - 교보문고LUVIT EPL과 유튜브 데이터로 배우는 DuckDB | 복잡한 데이터 분석 흐름을 더 단순하게 만드는 DuckDB 최근 주목받고 있는 DuckDB를 활용해 SQL 기반 데이터 분석과 실전 프로젝트를 학습할 수 있도록 구product.kyobobook.co.kr DuckDB와 Apache Iceberg를 활용해 현대적인 로컬 분석 스택을 구축하는 방법을 살펴봅니다. 프로덕션 환경에서도 활용 가능한 아키텍처와 Python 연동 방법, 그리고 확장 가능한 레이크하우스 워크플로까지 함께 알아봅니다. 한때 데이터 분석 플랫폼을 구축한다는 것..
2026.07.05
-
AI 시대에도 xAPI는 여전히 유효한가?
인공지능(AI)은 학습 방식을 빠르게 변화시키고 있습니다. 그렇다면 학습 경험을 추적하는 표준인 xAPI에는 어떤 의미가 있을까요?xAPI는 이제 더 이상 필요 없는 기술이 될까요?이 글에서는 AI 시대에 xAPI가 지닌 놀라운 잠재력을 살펴봅니다. 또한 xAPI와 AI가 서로를 대체하는 관계가 아니라, 함께 작동하여 더욱 개인화되고 강력한 학습 경험을 만들어낼 수 있는 방법을 소개합니다.xAPI 다시 살펴보기온라인 강의부터 실제 현장에서의 경험까지, 학습 과정에서 일어나는 모든 활동을 기록해 주는 도구가 있다고 상상해 보세요.이것이 바로 xAPI가 제공하는 핵심 가치입니다.xAPI는 여러분의 학습 여정을 기록하는 디지털 학습 이력장과 같고, 마치 뇌를 위한 피트니스 트래커와도 같습니다.전통적인 교실에서..
2026.06.30
-
Spark 클러스트를 대체하는 DuckDB: 비용 70%를 절감하다
https://product.kyobobook.co.kr/detail/S000220221456 LUVIT EPL과 유튜브 데이터로 배우는 DuckDB | 이기준 - 교보문고LUVIT EPL과 유튜브 데이터로 배우는 DuckDB | 복잡한 데이터 분석 흐름을 더 단순하게 만드는 DuckDB 최근 주목받고 있는 DuckDB를 활용해 SQL 기반 데이터 분석과 실전 프로젝트를 학습할 수 있도록 구product.kyobobook.co.kr Apache Spark를 AWS EMR에서 운영하던 환경을 DuckDB를 실행하는 단일 EC2 인스턴스로 전환하면서, 연간 36,000달러 이상의 클라우드 비용을 절감했고 ETL 파이프라인의 실행 속도는 11배 빨라졌습니다.예산을 조금씩 갉아먹던 기존 환경우리 데이터 팀은 S..
2026.06.28