|
86 | 86 | "metadata": {}, |
87 | 87 | "outputs": [], |
88 | 88 | "source": [ |
89 | | - "cmap = pd.read_csv(\n", |
| 89 | + "prism = pd.read_csv(\n", |
90 | 90 | " \"prism_train.csv\",\n", |
91 | 91 | " header=\"infer\",\n", |
92 | 92 | " index_col=0,\n", |
93 | 93 | ")\n", |
94 | | - "cmap_test = pd.read_csv(\n", |
| 94 | + "prism_test = pd.read_csv(\n", |
95 | 95 | " \"prism_test.csv\",\n", |
96 | 96 | " header=\"infer\",\n", |
97 | 97 | " index_col=0,\n", |
|
124 | 124 | "metadata": {}, |
125 | 125 | "outputs": [], |
126 | 126 | "source": [ |
127 | | - "y = cmap.to_numpy()\n", |
128 | | - "X = cmap.index.to_list()\n", |
| 127 | + "y = prism.to_numpy()\n", |
| 128 | + "X = prism.index.to_list()\n", |
129 | 129 | "X[:10], y" |
130 | 130 | ] |
131 | 131 | }, |
|
323 | 323 | "outputs": [], |
324 | 324 | "source": [ |
325 | 325 | "def save_submission(model, X_test, csv_name):\n", |
326 | | - " pred_df = pd.DataFrame(index=cmap_test[\"SMILES\"], columns=cmap.columns)\n", |
| 326 | + " pred_df = pd.DataFrame(index=prism_test[\"SMILES\"], columns=prism.columns)\n", |
327 | 327 | " pred_df[:] = model.predict(X_test)\n", |
328 | 328 | " # Annoyingly Kaggle can't seem to handle large matrix datasets \n", |
329 | 329 | " # & so we need to cut down our submission to just the first 30 cell lines\n", |
|
337 | 337 | "metadata": {}, |
338 | 338 | "outputs": [], |
339 | 339 | "source": [ |
340 | | - "X_test = cmap_test['SMILES'].to_list()\n", |
| 340 | + "X_test = prism_test['SMILES'].to_list()\n", |
341 | 341 | "new_X_test = []\n", |
342 | 342 | "for smiles in tqdm(X_test):\n", |
343 | 343 | " morgan_fingerprints = AllChem.GetHashedMorganFingerprint(\n", |
|
0 commit comments