{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.12.13","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[],"dockerImageVersionId":28755,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session\n\n# Use the kagglehub client library to attach Kaggle resources like competitions, datasets, and models to your session\n# Learn more about kagglehub: https://github.com/Kaggle/kagglehub/blob/main/README.md\n\nimport kagglehub\n# kagglehub.dataset_download('<owner>/<dataset-slug>')","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import os\nimport pandas as pd\n\nprint(\"=\" * 60)\nprint(\"🔍 CHECKING KAGGLE ENVIRONMENT\")\nprint(\"=\" * 60)\n\n# Check if data is available\ndata_dir = '/kaggle/input/aptos2019-blindness-detection'\n\nif os.path.exists(data_dir):\n    print(f\"✅ Data directory found: {data_dir}\")\n    print(\"\\n📂 Contents:\")\n    for item in os.listdir(data_dir):\n        print(f\"  - {item}\")\n    \n    # Check CSV files\n    if os.path.exists(f'{data_dir}/train.csv'):\n        train_df = pd.read_csv(f'{data_dir}/train.csv')\n        print(f\"\\n✅ train.csv loaded: {len(train_df)} rows\")\n        print(f\"   Columns: {train_df.columns.tolist()}\")\n        print(f\"\\n📊 Class distribution:\")\n        print(train_df['diagnosis'].value_counts().sort_index())\n    \n    # Check image folders\n    train_images_path = f'{data_dir}/train_images'\n    if os.path.exists(train_images_path):\n        train_images = os.listdir(train_images_path)\n        print(f\"\\n🖼️ Train images: {len(train_images)} files\")\n        if len(train_images) > 0:\n            print(f\"   Sample: {train_images[:3]}\")\n    \n    test_images_path = f'{data_dir}/test_images'\n    if os.path.exists(test_images_path):\n        test_images = os.listdir(test_images_path)\n        print(f\"🖼️ Test images: {len(test_images)} files\")\n        if len(test_images) > 0:\n            print(f\"   Sample: {test_images[:3]}\")\n    \nelse:\n    print(\"❌ Data directory not found!\")\n    print(\"\\n📂 Available directories in /kaggle/input:\")\n    if os.path.exists('/kaggle/input'):\n        for item in os.listdir('/kaggle/input'):\n            print(f\"  - {item}\")\n    else:\n        print(\"  /kaggle/input doesn't exist\")\n        print(\"  Please add the dataset via the Data sidebar\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2026-09-04T07:29:43.801911Z","iopub.execute_input":"2026-09-04T07:29:43.802153Z","iopub.status.idle":"2026-09-04T07:29:45.053794Z","shell.execute_reply.started":"2026-09-04T07:29:43.802091Z","shell.execute_reply":"2026-09-04T07:29:45.053161Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import os\nimport pandas as pd\n\nprint(\"=\" * 60)\nprint(\"🔍 VERIFYING DATA ACCESS\")\nprint(\"=\" * 60)\n\n# Try to access the data\ndata_dir = '/kaggle/input/aptos2019-blindness-detection'\n\nif os.path.exists(data_dir):\n    print(f\"✅ Data directory found: {data_dir}\")\n    print(\"\\n📂 Contents:\")\n    for item in os.listdir(data_dir):\n        size = os.path.getsize(f'{data_dir}/{item}') if os.path.isfile(f'{data_dir}/{item}') else 'folder'\n        print(f\"  - {item} ({size})\")\n    \n    # Load and preview train.csv\n    train_df = pd.read_csv(f'{data_dir}/train.csv')\n    print(f\"\\n✅ train.csv loaded: {len(train_df)} rows\")\n    print(f\"   Columns: {train_df.columns.tolist()}\")\n    print(f\"\\n📊 First 5 rows:\")\n    print(train_df.head())\n    \n    print(f\"\\n📊 Class distribution:\")\n    print(train_df['diagnosis'].value_counts().sort_index())\n    \nelse:\n    print(\"❌ Data directory not found!\")\n    print(\"Please make sure the dataset is properly attached.\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2026-09-04T07:31:03.014464Z","iopub.execute_input":"2026-09-04T07:31:03.014695Z","iopub.status.idle":"2026-09-04T07:31:03.020557Z","shell.execute_reply.started":"2026-09-04T07:31:03.014675Z","shell.execute_reply":"2026-09-04T07:31:03.019861Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import os\nimport subprocess\n\nprint(\"=\" * 60)\nprint(\"🔍 SEARCHING FOR APTOS DATA\")\nprint(\"=\" * 60)\n\n# Method 1: Check all directories in /kaggle/input\nprint(\"\\n📂 Checking /kaggle/input:\")\nif os.path.exists('/kaggle/input'):\n    for item in os.listdir('/kaggle/input'):\n        item_path = f'/kaggle/input/{item}'\n        print(f\"  - {item}\")\n        if os.path.isdir(item_path):\n            print(f\"    Contents: {os.listdir(item_path)[:5]}\")\nelse:\n    print(\"  /kaggle/input does not exist\")\n\n# Method 2: Search for train.csv anywhere in /kaggle\nprint(\"\\n🔎 Searching for train.csv in /kaggle...\")\nresult = subprocess.run(['find', '/kaggle', '-name', 'train.csv', '-type', 'f'], \n                       capture_output=True, text=True)\nif result.stdout:\n    print(f\"✅ Found train.csv at: {result.stdout}\")\nelse:\n    print(\"❌ train.csv not found in /kaggle\")\n\n# Method 3: Search for any file ending with .csv\nprint(\"\\n🔎 Searching for all CSV files in /kaggle...\")\nresult = subprocess.run(['find', '/kaggle', '-name', '*.csv', '-type', 'f', '-maxdepth', '3'], \n                       capture_output=True, text=True)\nif result.stdout:\n    print(\"Found CSV files:\")\n    for line in result.stdout.split('\\n'):\n        if line.strip():\n            print(f\"  {line}\")\nelse:\n    print(\"❌ No CSV files found in /kaggle\")\n\n# Method 4: Check the working directory\nprint(\"\\n📂 Current working directory contents:\")\nprint(os.listdir('.'))\n\n# Method 5: Check if data is in a different location\npossible_paths = [\n    '/kaggle/input/aptos2019-blindness-detection',\n    '/kaggle/input/aptos-2019-blindness-detection',\n    '/kaggle/input/aptos2019',\n    '/kaggle/input/aptos-blindness-detection',\n    '/kaggle/input/competitions/aptos2019-blindness-detection',\n    '/kaggle/working/aptos2019-blindness-detection',\n]\n\nprint(\"\\n📂 Checking common paths:\")\nfor path in possible_paths:\n    if os.path.exists(path):\n        print(f\"  ✅ EXISTS: {path}\")\n        print(f\"     Contents: {os.listdir(path)[:5]}\")\n    else:\n        print(f\"  ❌ Not found: {path}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2026-09-04T07:31:31.087858Z","iopub.execute_input":"2026-09-04T07:31:31.088107Z","iopub.status.idle":"2026-09-04T07:31:49.548374Z","shell.execute_reply.started":"2026-09-04T07:31:31.088076Z","shell.execute_reply":"2026-09-04T07:31:49.547746Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import pandas as pd\nimport numpy as np\nimport os\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.utils import shuffle\nfrom tensorflow.keras.preprocessing.image import ImageDataGenerator\nfrom tensorflow.keras.applications import DenseNet121\nfrom tensorflow.keras.layers import Dense, GlobalAveragePooling2D, Dropout\nfrom tensorflow.keras.models import Model\nfrom tensorflow.keras.optimizers import Adam\nfrom tensorflow.keras.callbacks import EarlyStopping, ModelCheckpoint\nimport matplotlib.pyplot as plt\n\nprint(\"=\" * 60)\nprint(\"🏥 APTOS 2019 - Diabetic Retinopathy Detection\")\nprint(\"=\" * 60)\n\n# ============================================\n# CORRECT DATA PATH\n# ============================================\ndata_dir = '/kaggle/input/competitions/aptos2019-blindness-detection'\n\nprint(f\"\\n📂 Data directory: {data_dir}\")\nprint(f\"📂 Contents: {os.listdir(data_dir)}\")\n\n# ============================================\n# LOAD DATA\n# ============================================\ntrain_df = pd.read_csv(f'{data_dir}/train.csv')\nprint(f\"\\n📊 Loaded {len(train_df)} training samples\")\n\n# Check class distribution\nprint(\"\\n📊 Class distribution (0=No DR, 4=Proliferative DR):\")\nclass_counts = train_df['diagnosis'].value_counts().sort_index()\nfor cls, count in class_counts.items():\n    print(f\"  Class {cls}: {count} images ({count/len(train_df)*100:.1f}%)\")\n\n# ============================================\n# SPLIT DATA\n# ============================================\ntrain_df = shuffle(train_df, random_state=42)\ntrain_df, val_df = train_test_split(train_df, test_size=0.2, random_state=42)\nprint(f\"\\n📊 Split: {len(train_df)} training, {len(val_df)} validation\")\n\n# ============================================\n# DATA GENERATORS\n# ============================================\nprint(\"\\n🔄 Setting up data generators...\")\n\ntrain_datagen = ImageDataGenerator(\n    rescale=1./255,\n    shear_range=0.2,\n    zoom_range=0.2,\n    horizontal_flip=True,\n    validation_split=0.15\n)\n\nval_datagen = ImageDataGenerator(rescale=1./255)\n\ndef create_generator(dataframe, datagen, subset=None, is_training=True):\n    return datagen.flow_from_dataframe(\n        dataframe=dataframe,\n        x_col='id_code',\n        y_col='diagnosis',\n        directory=f'{data_dir}/train_images/',\n        target_size=(224, 224),\n        batch_size=32,\n        class_mode='categorical',\n        subset=subset,\n        shuffle=True if is_training else False,\n        filepath='{id_code}.png'  # CRITICAL: Adds .png extension\n    )\n\ntrain_generator = create_generator(train_df, train_datagen, subset='training', is_training=True)\nvalidation_generator = create_generator(train_df, train_datagen, subset='validation', is_training=False)\n\nprint(f\"✅ Training batches: {len(train_generator)}\")\nprint(f\"✅ Validation batches: {len(validation_generator)}\")\n\n# ============================================\n# BUILD DENSENET MODEL\n# ============================================\nprint(\"\\n🏗️ Building DenseNet121 model...\")\n\nbase_model = DenseNet121(\n    weights='imagenet',\n    include_top=False,\n    input_shape=(224, 224, 3)\n)\nbase_model.trainable = False  # Freeze base layers\n\nx = base_model.output\nx = GlobalAveragePooling2D()(x)\nx = Dense(128, activation='relu')(x)\nx = Dropout(0.5)(x)\npredictions = Dense(5, activation='softmax')(x)\n\nmodel = Model(inputs=base_model.input, outputs=predictions)\n\nmodel.compile(\n    optimizer=Adam(learning_rate=0.0001),\n    loss='categorical_crossentropy',\n    metrics=['accuracy']\n)\n\nprint(\"✅ Model built successfully!\")\nmodel.summary()\n\n# ============================================\n# TRAIN MODEL\n# ============================================\nprint(\"\\n🏋️ Starting training...\")\n\nearly_stopping = EarlyStopping(\n    monitor='val_loss',\n    patience=5,\n    restore_best_weights=True\n)\n\nmodel_checkpoint = ModelCheckpoint(\n    'best_model.h5',\n    monitor='val_loss',\n    save_best_only=True\n)\n\n# Start with 10 epochs for a good balance of speed and accuracy\nhistory = model.fit(\n    train_generator,\n    epochs=10,\n    validation_data=validation_generator,\n    callbacks=[early_stopping, model_checkpoint],\n    verbose=1\n)\n\nprint(\"✅ Training complete!\")\n\n# ============================================\n# PLOT TRAINING HISTORY\n# ============================================\nfig, (ax1, ax2) = plt.subplots(1, 2, figsize=(12, 4))\n\nax1.plot(history.history['accuracy'], label='Training')\nax1.plot(history.history['val_accuracy'], label='Validation')\nax1.set_title('Model Accuracy')\nax1.set_xlabel('Epoch')\nax1.set_ylabel('Accuracy')\nax1.legend()\n\nax2.plot(history.history['loss'], label='Training')\nax2.plot(history.history['val_loss'], label='Validation')\nax2.set_title('Model Loss')\nax2.set_xlabel('Epoch')\nax2.set_ylabel('Loss')\nax2.legend()\n\nplt.tight_layout()\nplt.show()\n\n# ============================================\n# CREATE SUBMISSION\n# ============================================\nprint(\"\\n🔮 Making predictions on test set...\")\n\ntest_datagen = ImageDataGenerator(rescale=1./255)\ntest_df = pd.read_csv(f'{data_dir}/test.csv')\n\ntest_generator = test_datagen.flow_from_dataframe(\n    dataframe=test_df,\n    x_col='id_code',\n    directory=f'{data_dir}/test_images/',\n    target_size=(224, 224),\n    batch_size=32,\n    class_mode=None,\n    shuffle=False,\n    filepath='{id_code}.png'\n)\n\n# Load the best model\nfrom tensorflow.keras.models import load_model\nif os.path.exists('best_model.h5'):\n    print(\"📂 Loading best model...\")\n    model = load_model('best_model.h5')\n\npredictions = model.predict(test_generator, verbose=1)\npredicted_classes = np.argmax(predictions, axis=1)\n\n# Create submission\nsubmission = pd.DataFrame({\n    'id_code': test_df['id_code'],\n    'diagnosis': predicted_classes\n})\n\nsubmission.to_csv('submission.csv', index=False)\n\nprint(\"\\n✅ Submission created: submission.csv\")\nprint(\"\\n📊 Submission preview:\")\nprint(submission.head())\nprint(\"\\n📊 Predicted class distribution:\")\nprint(submission['diagnosis'].value_counts().sort_index())\n\nprint(\"\\n\" + \"=\" * 60)\nprint(\"✅ Done! Download submission.csv from the Output tab\")\nprint(\"=\" * 60)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2026-09-04T07:33:28.668101Z","iopub.execute_input":"2026-09-04T07:33:28.668413Z","iopub.status.idle":"2026-09-04T07:33:44.586857Z","shell.execute_reply.started":"2026-09-04T07:33:28.668386Z","shell.execute_reply":"2026-09-04T07:33:44.58593Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import pandas as pd\nimport numpy as np\nimport os\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.utils import shuffle\nfrom tensorflow.keras.preprocessing.image import ImageDataGenerator\nfrom tensorflow.keras.applications import DenseNet121\nfrom tensorflow.keras.layers import Dense, GlobalAveragePooling2D, Dropout\nfrom tensorflow.keras.models import Model\nfrom tensorflow.keras.optimizers import Adam\nfrom tensorflow.keras.callbacks import EarlyStopping, ModelCheckpoint\nimport matplotlib.pyplot as plt\n\nprint(\"=\" * 60)\nprint(\"🏥 APTOS 2019 - Diabetic Retinopathy Detection\")\nprint(\"=\" * 60)\n\n# ============================================\n# DATA PATH\n# ============================================\ndata_dir = '/kaggle/input/competitions/aptos2019-blindness-detection'\n\nprint(f\"\\n📂 Data directory: {data_dir}\")\nprint(f\"📂 Contents: {os.listdir(data_dir)}\")\n\n# ============================================\n# LOAD DATA - FIX: Convert diagnosis to string\n# ============================================\ntrain_df = pd.read_csv(f'{data_dir}/train.csv')\nprint(f\"\\n📊 Loaded {len(train_df)} training samples\")\n\n# Convert diagnosis to string (FIXES THE ERROR)\ntrain_df['diagnosis'] = train_df['diagnosis'].astype(str)\n\nprint(f\"\\n📊 Class distribution (0=No DR, 4=Proliferative DR):\")\nclass_counts = train_df['diagnosis'].value_counts().sort_index()\nfor cls, count in class_counts.items():\n    print(f\"  Class {cls}: {count} images ({count/len(train_df)*100:.1f}%)\")\n\n# ============================================\n# SPLIT DATA\n# ============================================\ntrain_df = shuffle(train_df, random_state=42)\ntrain_df, val_df = train_test_split(train_df, test_size=0.2, random_state=42)\nprint(f\"\\n📊 Split: {len(train_df)} training, {len(val_df)} validation\")\n\n# ============================================\n# DATA GENERATORS\n# ============================================\nprint(\"\\n🔄 Setting up data generators...\")\n\ntrain_datagen = ImageDataGenerator(\n    rescale=1./255,\n    shear_range=0.2,\n    zoom_range=0.2,\n    horizontal_flip=True,\n    validation_split=0.15\n)\n\nval_datagen = ImageDataGenerator(rescale=1./255)\n\ndef create_generator(dataframe, datagen, subset=None, is_training=True):\n    return datagen.flow_from_dataframe(\n        dataframe=dataframe,\n        x_col='id_code',\n        y_col='diagnosis',\n        directory=f'{data_dir}/train_images/',\n        target_size=(224, 224),\n        batch_size=32,\n        class_mode='categorical',\n        subset=subset,\n        shuffle=True if is_training else False,\n        filepath='{id_code}.png'  # Adds .png extension\n    )\n\ntrain_generator = create_generator(train_df, train_datagen, subset='training', is_training=True)\nvalidation_generator = create_generator(train_df, train_datagen, subset='validation', is_training=False)\n\nprint(f\"✅ Training batches: {len(train_generator)}\")\nprint(f\"✅ Validation batches: {len(validation_generator)}\")\n\n# ============================================\n# BUILD DENSENET MODEL\n# ============================================\nprint(\"\\n🏗️ Building DenseNet121 model...\")\n\nbase_model = DenseNet121(\n    weights='imagenet',\n    include_top=False,\n    input_shape=(224, 224, 3)\n)\nbase_model.trainable = False  # Freeze base layers\n\nx = base_model.output\nx = GlobalAveragePooling2D()(x)\nx = Dense(128, activation='relu')(x)\nx = Dropout(0.5)(x)\npredictions = Dense(5, activation='softmax')(x)\n\nmodel = Model(inputs=base_model.input, outputs=predictions)\n\nmodel.compile(\n    optimizer=Adam(learning_rate=0.0001),\n    loss='categorical_crossentropy',\n    metrics=['accuracy']\n)\n\nprint(\"✅ Model built successfully!\")\nmodel.summary()\n\n# ============================================\n# TRAIN MODEL\n# ============================================\nprint(\"\\n🏋️ Starting training...\")\n\nearly_stopping = EarlyStopping(\n    monitor='val_loss',\n    patience=5,\n    restore_best_weights=True\n)\n\nmodel_checkpoint = ModelCheckpoint(\n    'best_model.h5',\n    monitor='val_loss',\n    save_best_only=True\n)\n\n# Start with 10 epochs\nhistory = model.fit(\n    train_generator,\n    epochs=10,\n    validation_data=validation_generator,\n    callbacks=[early_stopping, model_checkpoint],\n    verbose=1\n)\n\nprint(\"✅ Training complete!\")\n\n# ============================================\n# PLOT TRAINING HISTORY\n# ============================================\nfig, (ax1, ax2) = plt.subplots(1, 2, figsize=(12, 4))\n\nax1.plot(history.history['accuracy'], label='Training')\nax1.plot(history.history['val_accuracy'], label='Validation')\nax1.set_title('Model Accuracy')\nax1.set_xlabel('Epoch')\nax1.set_ylabel('Accuracy')\nax1.legend()\n\nax2.plot(history.history['loss'], label='Training')\nax2.plot(history.history['val_loss'], label='Validation')\nax2.set_title('Model Loss')\nax2.set_xlabel('Epoch')\nax2.set_ylabel('Loss')\nax2.legend()\n\nplt.tight_layout()\nplt.show()\n\n# ============================================\n# CREATE SUBMISSION\n# ============================================\nprint(\"\\n🔮 Making predictions on test set...\")\n\ntest_datagen = ImageDataGenerator(rescale=1./255)\ntest_df = pd.read_csv(f'{data_dir}/test.csv')\n\ntest_generator = test_datagen.flow_from_dataframe(\n    dataframe=test_df,\n    x_col='id_code',\n    directory=f'{data_dir}/test_images/',\n    target_size=(224, 224),\n    batch_size=32,\n    class_mode=None,\n    shuffle=False,\n    filepath='{id_code}.png'\n)\n\n# Load the best model\nfrom tensorflow.keras.models import load_model\nif os.path.exists('best_model.h5'):\n    print(\"📂 Loading best model...\")\n    model = load_model('best_model.h5')\n\npredictions = model.predict(test_generator, verbose=1)\npredicted_classes = np.argmax(predictions, axis=1)\n\n# Create submission\nsubmission = pd.DataFrame({\n    'id_code': test_df['id_code'],\n    'diagnosis': predicted_classes\n})\n\nsubmission.to_csv('submission.csv', index=False)\n\nprint(\"\\n✅ Submission created: submission.csv\")\nprint(\"\\n📊 Submission preview:\")\nprint(submission.head())\nprint(\"\\n📊 Predicted class distribution:\")\nprint(submission['diagnosis'].value_counts().sort_index())\n\nprint(\"\\n\" + \"=\" * 60)\nprint(\"✅ Done! Download submission.csv from the Output tab\")\nprint(\"=\" * 60)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2026-09-04T08:52:00.886957Z","iopub.execute_input":"2026-09-04T08:52:00.887596Z","iopub.status.idle":"2026-09-04T08:52:35.839525Z","shell.execute_reply.started":"2026-09-04T08:52:00.887569Z","shell.execute_reply":"2026-09-04T08:52:35.838284Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import os\n\ndata_dir = '/kaggle/input/competitions/aptos2019-blindness-detection'\n\nprint(\"=\" * 60)\nprint(\"🔍 CHECKING ACTUAL FILENAMES\")\nprint(\"=\" * 60)\n\n# Check train images\ntrain_path = f'{data_dir}/train_images'\nif os.path.exists(train_path):\n    train_files = os.listdir(train_path)\n    print(f\"\\n📂 Train images: {len(train_files)} files\")\n    print(f\"   First 5 files: {train_files[:5]}\")\n    \n    # Check if files have .png or .jpg extension\n    extensions = set()\n    for f in train_files[:100]:\n        ext = os.path.splitext(f)[1]\n        extensions.add(ext)\n    print(f\"   File extensions found: {extensions}\")\n\n# Check test images\ntest_path = f'{data_dir}/test_images'\nif os.path.exists(test_path):\n    test_files = os.listdir(test_path)\n    print(f\"\\n📂 Test images: {len(test_files)} files\")\n    print(f\"   First 5 files: {test_files[:5]}\")\n\n# Check CSV IDs\nimport pandas as pd\ntrain_df = pd.read_csv(f'{data_dir}/train.csv')\nprint(f\"\\n📊 CSV id_code samples: {train_df['id_code'].head(10).tolist()}\")\n\n# Compare CSV IDs with actual filenames\nprint(f\"\\n🔍 Checking if CSV IDs match filenames:\")\nsample_id = train_df['id_code'].iloc[0]\nprint(f\"   CSV ID: {sample_id}\")\nprint(f\"   Looking for: {sample_id}.png\")\nprint(f\"   Exists: {os.path.exists(f'{train_path}/{sample_id}.png')}\")\nprint(f\"   Looking for: {sample_id}.jpg\")\nprint(f\"   Exists: {os.path.exists(f'{train_path}/{sample_id}.jpg')}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2026-09-04T07:35:21.163341Z","iopub.execute_input":"2026-09-04T07:35:21.163591Z","iopub.status.idle":"2026-09-04T07:35:21.178409Z","shell.execute_reply.started":"2026-09-04T07:35:21.163571Z","shell.execute_reply":"2026-09-04T07:35:21.17756Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import pandas as pd\nimport numpy as np\nimport os\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.utils import shuffle\nfrom tensorflow.keras.preprocessing.image import ImageDataGenerator\nfrom tensorflow.keras.applications import DenseNet121\nfrom tensorflow.keras.layers import Dense, GlobalAveragePooling2D, Dropout\nfrom tensorflow.keras.models import Model\nfrom tensorflow.keras.optimizers import Adam\nfrom tensorflow.keras.callbacks import EarlyStopping, ModelCheckpoint\nimport matplotlib.pyplot as plt\n\nprint(\"=\" * 60)\nprint(\"🏥 APTOS 2019 - Diabetic Retinopathy Detection\")\nprint(\"=\" * 60)\n\n# ============================================\n# DATA PATH\n# ============================================\ndata_dir = '/kaggle/input/competitions/aptos2019-blindness-detection'\n\n# ============================================\n# LOAD DATA\n# ============================================\ntrain_df = pd.read_csv(f'{data_dir}/train.csv')\ntrain_df['diagnosis'] = train_df['diagnosis'].astype(str)\n\nprint(f\"\\n📊 Loaded {len(train_df)} training samples\")\n\nprint(\"\\n📊 Class distribution:\")\nclass_counts = train_df['diagnosis'].value_counts().sort_index()\nfor cls, count in class_counts.items():\n    print(f\"  Class {cls}: {count} images ({count/len(train_df)*100:.1f}%)\")\n\n# ============================================\n# ADD FULL PATH TO DATAFRAME\n# ============================================\n# This is the key fix - add the full path and extension directly\ntrain_df['image_path'] = f'{data_dir}/train_images/' + train_df['id_code'] + '.png'\n\nprint(f\"\\n📂 Sample image path: {train_df['image_path'].iloc[0]}\")\nprint(f\"   File exists: {os.path.exists(train_df['image_path'].iloc[0])}\")\n\n# ============================================\n# SPLIT DATA\n# ============================================\ntrain_df = shuffle(train_df, random_state=42)\ntrain_df, val_df = train_test_split(train_df, test_size=0.2, random_state=42)\nprint(f\"\\n📊 Split: {len(train_df)} training, {len(val_df)} validation\")\n\n# ============================================\n# DATA GENERATORS - USING FULL PATH\n# ============================================\nprint(\"\\n🔄 Setting up data generators...\")\n\ntrain_datagen = ImageDataGenerator(\n    rescale=1./255,\n    shear_range=0.2,\n    zoom_range=0.2,\n    horizontal_flip=True,\n    validation_split=0.15\n)\n\nval_datagen = ImageDataGenerator(rescale=1./255)\n\ndef create_generator(dataframe, datagen, subset=None, is_training=True):\n    return datagen.flow_from_dataframe(\n        dataframe=dataframe,\n        x_col='image_path',      # Use the full path column\n        y_col='diagnosis',\n        target_size=(224, 224),\n        batch_size=32,\n        class_mode='categorical',\n        subset=subset,\n        shuffle=True if is_training else False\n        # No directory or filepath needed - using full path in x_col\n    )\n\ntrain_generator = create_generator(train_df, train_datagen, subset='training', is_training=True)\nvalidation_generator = create_generator(train_df, train_datagen, subset='validation', is_training=False)\n\nprint(f\"✅ Training batches: {len(train_generator)}\")\nprint(f\"✅ Validation batches: {len(validation_generator)}\")\n\nif len(train_generator) == 0:\n    raise ValueError(\"No images found! Please check the image paths.\")\n\n# ============================================\n# BUILD DENSENET MODEL\n# ============================================\nprint(\"\\n🏗️ Building DenseNet121 model...\")\n\nbase_model = DenseNet121(\n    weights='imagenet',\n    include_top=False,\n    input_shape=(224, 224, 3)\n)\nbase_model.trainable = False\n\nx = base_model.output\nx = GlobalAveragePooling2D()(x)\nx = Dense(128, activation='relu')(x)\nx = Dropout(0.5)(x)\npredictions = Dense(5, activation='softmax')(x)\n\nmodel = Model(inputs=base_model.input, outputs=predictions)\n\nmodel.compile(\n    optimizer=Adam(learning_rate=0.0001),\n    loss='categorical_crossentropy',\n    metrics=['accuracy']\n)\n\nprint(\"✅ Model built successfully!\")\nmodel.summary()\n\n# ============================================\n# TRAIN MODEL (TEST RUN - 2 epochs)\n# ============================================\nprint(\"\\n🏋️ Starting training (2 epochs test run)...\")\n\nearly_stopping = EarlyStopping(\n    monitor='val_loss',\n    patience=5,\n    restore_best_weights=True\n)\n\nmodel_checkpoint = ModelCheckpoint(\n    'best_model.h5',\n    monitor='val_loss',\n    save_best_only=True\n)\n\nhistory = model.fit(\n    train_generator,\n    epochs=2,  # Start with 2 for testing\n    validation_data=validation_generator,\n    callbacks=[early_stopping, model_checkpoint],\n    verbose=1\n)\n\nprint(\"✅ Training complete!\")\n\n# ============================================\n# PLOT TRAINING HISTORY\n# ============================================\nfig, (ax1, ax2) = plt.subplots(1, 2, figsize=(12, 4))\n\nax1.plot(history.history['accuracy'], label='Training')\nax1.plot(history.history['val_accuracy'], label='Validation')\nax1.set_title('Model Accuracy')\nax1.set_xlabel('Epoch')\nax1.set_ylabel('Accuracy')\nax1.legend()\n\nax2.plot(history.history['loss'], label='Training')\nax2.plot(history.history['val_loss'], label='Validation')\nax2.set_title('Model Loss')\nax2.set_xlabel('Epoch')\nax2.set_ylabel('Loss')\nax2.legend()\n\nplt.tight_layout()\nplt.show()\n\n# ============================================\n# CREATE SUBMISSION\n# ============================================\nprint(\"\\n🔮 Making predictions on test set...\")\n\ntest_datagen = ImageDataGenerator(rescale=1./255)\ntest_df = pd.read_csv(f'{data_dir}/test.csv')\n\n# Add full path to test images\ntest_df['image_path'] = f'{data_dir}/test_images/' + test_df['id_code'] + '.png'\n\ntest_generator = test_datagen.flow_from_dataframe(\n    dataframe=test_df,\n    x_col='image_path',  # Use full path\n    target_size=(224, 224),\n    batch_size=32,\n    class_mode=None,\n    shuffle=False\n)\n\n# Load the best model\nfrom tensorflow.keras.models import load_model\nif os.path.exists('best_model.h5'):\n    print(\"📂 Loading best model...\")\n    model = load_model('best_model.h5')\n\npredictions = model.predict(test_generator, verbose=1)\npredicted_classes = np.argmax(predictions, axis=1)\n\n# Create submission\nsubmission = pd.DataFrame({\n    'id_code': test_df['id_code'],\n    'diagnosis': predicted_classes\n})\n\nsubmission.to_csv('submission.csv', index=False)\n\nprint(\"\\n✅ Submission created: submission.csv\")\nprint(\"\\n📊 Submission preview:\")\nprint(submission.head())\nprint(\"\\n📊 Predicted class distribution:\")\nprint(submission['diagnosis'].value_counts().sort_index())\n\nprint(\"\\n\" + \"=\" * 60)\nprint(\"✅ Done! Download submission.csv from the Output tab\")\nprint(\"=\" * 60)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2026-09-04T08:54:20.665768Z","iopub.execute_input":"2026-09-04T08:54:20.665992Z","iopub.status.idle":"2026-09-04T09:08:53.897513Z","shell.execute_reply.started":"2026-09-04T08:54:20.66597Z","shell.execute_reply":"2026-09-04T09:08:53.896871Z"}},"outputs":[],"execution_count":null}]}