You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
Copy file name to clipboardExpand all lines: README.md
+1-1Lines changed: 1 addition & 1 deletion
Display the source diff
Display the rich diff
Original file line number
Diff line number
Diff line change
@@ -15,7 +15,7 @@ db: создается база данных и таблица если их е
15
15
Pipeline: программа запускается скриптом разделенным на 5 основных модулей (db.py, extract.py, load.py, transform.py, main.py)
16
16
17
17
### Схема ETL
18
-
top-headlines из NewsApi (extract) -> Филтр на наличие автора, заголовка, описания не меньше 20 символов, наличие url (transform) -> загрузка статей чей url отсутствует в базе данных (load)
18
+
Everything из NewsApi (extract) -> Филтр на наличие автора, заголовка, описания не меньше 20 символов, наличие url (transform) -> загрузка статей чей url отсутствует в базе данных (load)
Copy file name to clipboardExpand all lines: notebooks/01_eda.ipynb
+20-2Lines changed: 20 additions & 2 deletions
Original file line number
Diff line number
Diff line change
@@ -15,8 +15,26 @@
15
15
"import os\n",
16
16
"from pathlib import Path \n",
17
17
"import pandas as pd \n",
18
-
"import mathplotlib.pyplot as plt \n",
19
-
"3"
18
+
"import mathplotlib.pyplot as plt \n"
19
+
]
20
+
},
21
+
{
22
+
"cell_type": "markdown",
23
+
"id": "8f9db0d1",
24
+
"metadata": {},
25
+
"source": [
26
+
"В чем поинт происходящего. Помимо очевидного сбора новостей, мне захотелось собрать некую статистику. \n",
27
+
"Как много статей от общего числа не проходят фильтр?\n",
28
+
"По каким критериям они не проходят?\n",
29
+
"Что является первичной причиной отброса?\n",
30
+
"Как часто по каждому ключевому слову попадаются одинаковые ссылки?\n",
31
+
"и главный вопрос, кто такой E_nota?\n",
32
+
"\n",
33
+
"Что будет происходить у меня далее?\n",
34
+
"Я буду считывать статистику из data/clean/stats скорее всего я буду после этого чистить папки data/clean и data/raw чтобы избегать использования лишней памяти. После чего я буду строить графики на тему:\n",
35
+
"А что является чаще всего причиной отброса в целом?\n",
36
+
"А что явяется чаще всего причиной по каждой теме?\n",
37
+
"А какое ключивое слово имеет больше всего одинаковых ссылок?"
0 commit comments