| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- coding
- Heapreplace
- os.path.join
- linalg.solve()
- 빅데이터분석기사
- request Method
- array
- 빅분기
- namedTuple
- np.savetxt()
- matplotlib
- 빅데이터
- deg2rad
- 실기
- np.load()
- 비가변매개변수
- 필답형
- Collections
- set_index
- numpy
- DEEPLEARNING
- Python
- Math Function
- kaggle
- BASIC
- list
- 가변매개변수
- np.save()
- 작업형
- heapmerge
- Today
- Total
목록전체 글 (36)
맞춤형 플랫폼 개발 도전기 (웹개발, 딥러닝, 블록체인)
머신러닝 프로세스는 크게 1. 데이터셋 (Data Set) 분할 2. Data 전처리 3. Model 학습 4. Hyper Parameter 탐색과 Model Tuning 5. Model 성능 평가 로 나눌 수 있다. 데이터셋을 분할할 때는 어떤 것을 독립변수, 종속변수로 할지 정한 뒤, 학습용 데이터와 테스트용 데이터로 분할한다. 일반적으로 학습데이터 70~80%, 학습된 모델이 다른 데이터에도 맞는지 확인(일반화가 잘 되었는지)하기 위한 테스트데이터 20~30%로 나눈다. 그러고 난 후, 독립변수(X)를 정규화시켜야 한다. 단위가 다르거나 범주형일 경우 변수 간의 거리나 상관관계에 있어 왜곡이 생길 수 있기 때문이다. 정규화에는 Standardization과 MinMax 가 있다. MinMax 예시는..
필답형이 30점을 차지하기 때문에 준비를 안할 수는 없다. 그래서 중요도가 높다고 생각되는 부분 위주로 정리하겠다. 1. 빅데이터 기술 및 제도 빅데이터 플랫폼 : 수집 → 저장 → 처리 → 분석 → 시각화 과정 (빅데이터에서 가치를 추출하기 위한 일련의 과정) 을 규격화한 기술 빅데이터 플랫폼 구성 요소 - 데이터 수집 : 원천 데이터의 정형, 반정형, 비정형 데이터 수집 (ETL, Crawler, EAI) * 크롤러 : URL에 존재하는 HTML 문서에 접근해 해당 내용을 추출하고, 문서에 포함된 하이퍼링크를 통해 재귀적으로 다른 문서에 접근해 콘텐트 수집 반복 * EAI (Enterprise Architecture Integration) : 기업에서 운영하는 서로 다은 기종의 Application ..
JavaScript로 Crawling하는 것은 저번에 해 보았다. JavaScript로 Open API 데이터 가져오기 (영화진흥위원회, 서울 열린데이터 광장) 이전에 본격적으로 데이터를 크롤링해보겠다고 했는데, Open API를 통해 데이터를 가져와 표로 만들어 보았다. Open API를 제공하는 곳은 많지만, 일단, 공공데이터를 가져와보았다. 보통 xml과 json으 katieyoon-the-developer.tistory.com 이번에는 Python으로 Crawling을 해보려 한다. 보통 Crawling이나 Scraping은 대형 포털등에서 통채로 불러올때 쓰는 말이고, 지금 하고자 하는 건 Parsing에 가깝다. 하지만 Crawling 이나 Scraping을 위해서는 Parsing이 기본이 되..
빅데이터분석 능력을 평가하는 자격증 중, 국가기술자격증은 없었다. 하지만 작년에 빅데이터분석기사라는 시험이 시행됨에 다라 빅데이터분석 능력을 일부라도 검증받을 수 있게 되었다. 하지만 절대적인 척도가 될 수는 없다. 빅데이터분석이라는 분야가 정말 넓고, 깊은 전문성을 요하기 때문이다. 그래서 정보처리기사처럼 '기본'을 갖췄는지에 대한 평가 정도라고 생각하면 될 것 같다. 12월 4일 빅데이터분석기사 시험이라, 오늘부터 짬을 내서 공부를 해보려 한다. 나 외에도 준비하는 사람이 있다면 도움을 받았으면 좋겠다는 생각으로 기록을 남긴다. ※ 자동완성이 없기 때문에 함수, 패키지의 이름을 제대로 기억해야 한다. 아래에 빅데이터분석기사에서 꼭 알아야 하는 Numpy, Pandas의 기본적인 부분들을 대략적으로 정..
이 문제는 그냥 풀수도 있고, collections를 이용해서 풀 수도 있다. 그냥 풀면 효율성 검사에서 통과하지 못한다. del(remove) 연산이 최악의 경우에 O(n)이 걸리기 때문에 통과하지 못하는 것으로 보인다. Counter는 dictionary이기 때문에 key가 같다면 연산도 가능한 점을 이용한다면 금방 풀 수 있다. 공식화하고 싶다면 (중복되는 → 개수 확인해야 한다 → Counter 사용) 이라고 생각해도 나쁘지 않은 것 같다. import collections # 1. def solution_coll(participant, completion): print(collections.Counter(participant)) print(collections.Counter(completion)..
1. Heapq 자료구조, 알고리즘에서 heapq 정말 많이 사용한다. 문제를 풀때, heapq를 사용하지 않고 풀 수 있음에도 불구하고 heapq를 안쓰면 효율성 부분에서 테스트케이스가 통과하지 못할 때가 있다. 따라서, heapq의 사용법은 익혀두는 것이 좋다. heap은 자식노드가 부모노드와 정렬관계를 가지는 트리형 자료구조이다. binary heap의 경우에는 array나 list를 사용해서 표현할 수 있고, index를 이용해서 표시할 수 있다. n(index)를 부모로 하는 자식 노드의 위치 수식은 2*n +1, 2*n + 2이다. heap은 max-heap(부모가 자식보다 크거나 같음)과 min-heap(부모가 자식보다 같거나 작음)가 있다. Python의 경우에 heap module은 최소..
Collections 가 Python의 꽃이라고 할 수 있을까 싶다. C, Java, Python 을 거치면서 결국 Python을 주 언어로 선택한 것은 Python의 Collections 같은 모듈 때문이다. 물론 Java나 C 보다 속도나 유지보수성은 떨어지지만, 편리한 모듈들이 많아서 코딩하기 편하고, 범용성이 높기 때문이다. Collections가 특히나 그렇다. Collections에 대한 자세한 설명은 아래 공식 문서를 참조하면 좋을 듯하다. collections — Container datatypes — Python 3.10.0 documentation collections — Container datatypes Source code: Lib/collections/__init__.py Thi..
Series가 1차원이라면 DataFrame은 2차원으로 확대된 것이라고 생각하면 쉽다. DataFrame은 2차원이기 때문에 인덱스가 row, column로 구성되어 있다. (row는 개별 데이터, column은 개별 속성) DataFrame은 데이터를 읽어와서 가공하는 과정까지로 설명하는게 쉽다. 1. pd.read_csv(filepath) Kaggle에서 연습용 데이터로 가장 많이 사용하는 Titanic 데이터를 예시로 설명하겠다. import pandas as pd filepath = r'C:\User\data\titanic.csv' titanic_df = pd.read_csv(filepath) 이런 형식으로 파일을 읽어올 수 있다. 여기서 옵션을 몇개 줄 수 있다 df = pd.read_csv(..