전체 글

Kyeong6's Journey
[Distributed System] Docker를 이용한 완전 분산 모드 세팅
완전 분산 모드란?완전 분산 모드(Fully Distributed Mode)는 여러 대의 컴퓨터를 연결하여 하나의 큰 클러스터처럼 구성하여 데이터를 분산 처리하는 방식이다. 결국 물리 서버나 가상 머신(VM)을 직접 설정해야하는데 이는 복잡하고 시간 소모가 크다. 과제 진행을 위해서 '완전 분산 모드'를 해야하는데 막막했었는데 생각한 것이 바로 컨테이너 기술인 Docker를 활용하는 것이다. Docker를 통해서 여러 개의 컨테이너를 클러스터처럼 사용한다면 충분히 구현할 수 있기 때문이다. 이전 포스팅에서 Docker 및 Docker compose에 대한 설치 내용은 언급했기 때문에 이후 내용부터 작성하려한다. [Distributed System] Hadoop + EleasticSearch 연동분산시스..
[Distributed System] 병목 구간 식별 및 이상 탐지 시스템 구축
1. 데이터 설명1️⃣ 선정 이유분산 시스템 과목의 기말과제를 앞두고 "데이터 선정"에 대한 고민이 많았다. 대규모는 아니어도 어느 정도 규모가 있는 데이터셋이면서 실시간에 준하였으면 했기 때문이다. 이때 생각이 난게 인턴 과정에서 사용한 테스트 데이터셋이었다! 해당 데이터셋 같은 경우 2020년 1월1일 00:00부터 2021년 1월1일 00:00까지 분 단위로 수집된 데이터로 전체 527,041행(36.1MB)의 CSV 파일이다. 분산 저장, 배치 처리, 집계 및 분석 등 분산 시스템 과목에서 배운 전 과정을 적용할 수있어 선택하게 되었다. 2️⃣ 구조적 특징데이터셋에 대한 설명은 다음과 같다.정형화된 스키마: 총 15개 컬럼 모두 수치형(정수/실수) 구조를 가지며, 전체 행에 결측치가 존재하지 않..
[Distributed System] Hadoop + EleasticSearch 연동
분산시스템 수강대학교 마지막 하기에 '데이터 엔지니어링'과 밀접한 관련있는 과목인 분산시스템을 수강했다. 원래 개설되지 않았던 과목이라 이번 학기에 운 좋게 듣게 되었는데, 관심이 많았던 분야라 그런지 A+이라는 좋은 성적도 얻었다.🙃 이 수업은 이론보다는 프로젝트·과제 중심으로 진행되었고, 중간·기말 과제를 통해 Hadoop, Hive, HBase, Spark 같은 분산 기술을 이용하여 직접 설치 및 구성하고 실습해 볼 수 있었다. 과제를 수행하며 작성한 보고서를 바탕으로 배운 내용을 복습하고 실제 경험을 공유하고자 글을 작성하려고 한다. 내용을 설명하기 전에 수업과 과제를 통해 느낀 가장 큰 장점은 어렵게만 보이던 분산시스템의 개념과 용어를 딥하게 배우지는 못했더라도 '직접 해보는' 과정을 통해 전..
[Tabula] IR 자료 작성하기
·Project/Tabula
네이버 D2SF?오늘 Tabula 서비스로 네이버 D2SF의 캠퍼스 기술창업 공모전에 지원서를 제출했다. 네이버 D2SF에 관해 간단하게 소개하자면 네이버의 CV(Corportae Venturing)팀으로, '기술의 가능성'과 '스타트업과의 시너지'라는 철학을 바탕으로 다양한 기술 스타트업을 발굴하고 지원하는 회사이다. 해당 공모전 같은 경우 링크드인에서 우연히 발견하게 되었고, 네이버 D2SF가 가진 리소스와 멘토링은 우리 서비스의 잠재력을 실제 성과로 전환할 수 있는 기회라고 판단하여 지원을 결심하게 되었다. IR 자료를 처음 만들어 본 경험지원하기 위해 가장 어려웠던 것은 IR 자료 제작이었다. 그동안 여러 발표자료를 만들어본 경험이 있지만 투자 유치를 위한 자료, 즉 외부 투자자 대상으로 검토받..
1년에 10억 버는 방구석 비즈니스
·Business
책 소개요즘 비즈니스 관점에서 생각을 많이 하다보니 자연스럽게 관련한 책들을 읽고있다. 구글 서칭과 유튜브에 많은 비즈니스 내용이 존재하지만, 역시 나에게는 책을 통해 학습하는 게 익숙하고, 학습이 잘 되는 것 같다."1년에 10억 버는 방구석 비즈니스" 책은 한 3일정도 틈틈이 읽다 보니 생각보다 빠르게 완독했다. 비교적 다른 비즈니스 책들에서의 개념적 서술보다 이야기하듯이 사례를 풀어서 설명이 되어있어 이해하기가 편했던 것 같다. 책 제목이 생각보다 우스꽝스러운데 내용은 전혀 그러지 않다!👍본 포스팅에서는 책을 읽고난 뒤 인상깊은 구절과 현재 내가 진행 중인 서비스에 대해 적용할만 요소들을 정리하고자 한다.책에서 배운 핵심 포인트먼저, 책에서 나온 인사이트를 정리하고자 한다.01. 사업하기 전 알아..
[Tabula] CH01. 비즈니스 관점에서 시작하기
·Project/Tabula
학습자 메타인지 활성화를 위한 백지학습 플랫폼: Tabula졸업까지 1학기를 남긴 지금, 학교에서의 마지막 프로젝트인 캡스톤디자인을 진행하고 있다. 운 좋게 동아리원들과 한 팀을 이루게 되었다.🙃 오래만에 새로운 프로젝트를 하려고 하니 낯설면서도, 역시나 프로젝트의 기획 단계는 언제나 그렇듯 쉽지 않다. 팀원들과 많은 이야기를 나누며 나온 여러 아이디어 중에 한 팀원이 "백지학습법"에 관한 주제를 제안했고, 평소에도 암기과목을 공부할 때 많이 사용하는 방식이여서 나에게 매력적으로 다가왔다. 비즈니스 관점에서의 고민이전 프로젝트인 EATceed의 실서비스 출시 경험을 통해 많은 것을 느꼈다. 이중 가장 크게 와닿은 것은 서비스를 실제 시장에 선보이고 나서야, 단순히 기술적인 완성도에만 집중하는 것이 아..
[EATceed] CH07. AWS Lambda와 Slack을 활용한 데이터 파이프라인 구축기
·Project/EATceed
들어가며 이전 포스팅에서 언급했듯이 EATceed 서비스는 AI 영양사와 푸드렌즈 기능을 제공하고 있다. 이러한 기능이 안정적으로 동작하기 위해서는 정확하고 신뢰할 수 있는 음식 데이터가 필수적으로 요구된다. 특히, 공공데이터 포털에서 제공하는 전국통합식품영양성분정보(음식)표준데이터는 서비스의 핵심 기반이 되는 정보로, 이를 정기적으로 갱신하고 관리하는 작업은 매우 중요하다. 초기에는 데이터를 수작업으로 수집하고 내부 저장소(관계형 데이터베이스, 벡터 데이터베이스)에 직접 적재했지만, 시간이 지날수록 다음과 같은 문제들이 발생했다.새로운 데이터가 등록되었는지 매번 공공데이터 포털에서 수동으로 확인해야하는 모니터링 부담영양 성분 단위 변환 등 반복적 작업에서 발생하는 사소한 실수지속적인 운영 리소스 낭비..
[EATceed] CH06. LLM 응답의 품질 검증과 안정적인 운영을 위한 Fallback 패턴
·Project/EATceed
들어가며이전 포스팅에서는 실서비스 운영을 고려한 성능 최적화에 대해 다뤘다. 물론 빠른 응답 속도와 정확도도 중요하지만 실제 사용자에게 AI 기반 서비스를 제공할 때 가장 중요한 요소는 신뢰할 수 있는 품질의 응답을 일관되게 제공하는 것이다. EATceed의 AI 영양사 기능은 사용자의 건강에 직접적인 영향을 주는 정보를 제공하기 때문에 응답의 정확성과 안정성은 곧 서비스의 핵심 경쟁력이라고 볼 수 있다. 하지만 현실적으로 LLM 기반의 응답은 품질이 항상 일정하지 않고, OpenAI와 같은 외부 API에 대한 높은 의존도 역시 시스템 안정성을 위협할 수 있는 요소이다. 이를 해결하기 위해 두 가지 전략을 도입하게 되었다. Testing ChainLLM이 생성한 답변을 스스로 평가(G-Eval)하고 기준..
[EATceed] CH05. 실서비스를 고려한 성능 최적화
·Project/EATceed
들어가며EATceed의 AI 기능은 음식 이미지 판별인 푸드렌즈 기능과 식습관 분석, 일명 AI 영양사 기능을 핵심으로 삼고있다. 유저 관점에서 생각했을 때 보다 정확하고 빠른 서비스를 제공하기 위해 내부적으로 여러 가지 성능 최적화와 안정성 개선을 위해 작업을 진행했는데, 이번 포스팅에서 작업에 대한 과정을 중심으로 어떻게 테스트·구현했는지 공유하고자 합니다. 푸드렌즈: 성능 최적화 푸드렌즈 기능은 사용자가 업로드한 음식 사진을 인식해 정확한 음식명을 찾아주는 것이 핵심이다. 본 서비스에서는 편의성을 위해 음식명에 따른 영양성분 정보도 함께 제공해야 하므로 AI 모델이 탐지한 음식명과 DB에 사전 적재해둔 음식명 같의 불일치 문제가 발생한다. 예를 들어, AI 모델은 "김치"라고 탐지했는데 DB에는 "..
Kyeong6
Kyeong6's Journey