{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load in \n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the \"../input/\" directory.\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# Any results you write to the current directory are saved as output.","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"train_path = '../input/tensorflow2-question-answering/simplified-nq-train.jsonl'","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","trusted":true},"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport dask.bag as db \nimport json\nimport re \nfrom tqdm import tqdm\n\nimport torch\nfrom transformers import BertTokenizer, BertModel, BertForQuestionAnswering\nimport torch.nn as nn\nimport sklearn\nfrom sklearn.model_selection import train_test_split","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"!pip install transformers ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"input_token_ids = tokenizer.encode(\"I am Alexander\", \"Who am I?\")\nprint(input_token_ids)\nsegment_ids = [0 if i <= input_token_ids.index(102) else 1 for i in range(len(input_token_ids))]\nprint(segment_ids)\n\n# model = BertForQuestionAnswering.from_pretrained('bert-large-uncased-whole-word-masking-finetuned-squad')\n# start_scores, end_scores = model(torch.tensor([input_token_ids]), token_type_ids=torch.tensor([segment_ids]))\n# all_tokens = tokenizer.convert_ids_to_tokens(input_token_ids)\n# print(' '.join(all_tokens[torch.argmax(start_scores) : torch.argmax(end_scores)+1]))","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def tokenize_text(text, question, max_seq_length):\n    token_ids = tokenizer.encode(text, question)\n    segment_ids = [0 if i <= token_ids.index(102) else 1 for i in range(len(token_ids))]\n    mask = [1 for i in range(len(token_ids))]\n\n    \n    padding = [0] * (max_seq_length - len(token_ids))\n\n    token_ids += padding\n    segment_ids += padding\n    mask += padding\n    \n\n    return token_ids, segment_ids, mask","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"class WikiArticles:\n    def __init__(self, path, max_article_length):\n        self.path = path\n        self.data = None\n        self.max_article_length = max_article_length\n        self.input_token_ids = None\n        self.segment_ids = None\n        self.mask = None\n        self.answers = None\n    \n    def download_data(self, n):\n        data = []\n        with open(self.path, 'r') as f:\n            for key, value in tqdm(enumerate(f)):\n                if (key+1) % n == 0:\n                    break \n                el = json.loads(value)\n                data.append(el)\n        \n        data = pd.DataFrame(data)\n        data['yes_no'] = data['annotations'].apply(lambda x: x[0]['yes_no_answer'])\n        \n        data['long_start'] = data['annotations'].apply(lambda x: x[0]['long_answer']['start_token'])\n        data['long_end'] = data['annotations'].apply(lambda x: x[0]['long_answer']['end_token'])\n        \n        data['short'] = data['annotations'].apply(lambda x: x[0]['short_answers'])\n        \n        start_values = []\n        end_values = []\n            \n        for el in data['short']:\n            end = -1\n            start = -1\n            \n            if len(el) > 0:\n                end = el[0]['end_token']\n                start = el[0]['start_token']\n            \n            start_values.append(start)\n            end_values.append(end)\n            \n        data['short_start'] = start_values\n        data['short_end'] = end_values\n        \n        self.data = data.loc[:, ['document_text', 'question_text', 'example_id', 'yes_no', \n                                 'long_start', 'long_end', 'short_start', 'short_end']]\n        \n    def process(self):\n        data = self.data\n        input_token_ids_list = []\n        segment_ids_list = []\n        mask_list = []\n        answers = []\n\n        n = data.shape[0]\n        \n        for i in range(n):\n\n            article = data.iloc[i, 0]\n\n            if len(article.split()) < self.max_article_length:\n                question = data.iloc[i, 1]\n\n                start_long = data.iloc[i, 4]\n                end_long = data.iloc[i, 5]\n                start_short = data.iloc[i, 6]\n                end_short = data.iloc[i, 7]\n\n                answer = np.zeros((1, 2, self.max_article_length+1))\n\n                if data.iloc[i, 3] == \"YES\":\n                    answer[0, :, 0] = 1\n                \n                if start_long >= 0:\n                    answer[0, 0, start_long+1] = 1\n                    answer[0, 0, end_long+1] = 1\n                \n                if start_short >= 0:\n                    answer[0, 1, start_short+1] = 1\n                    answer[0, 1, end_short+1] = 1\n                \n                input_token_ids, segment_ids, mask = tokenize_text(article, question, self.max_article_length)\n                input_token_ids_list.append(input_token_ids)\n                segment_ids_list.append(segment_ids)\n                mask_list.append(mask)\n                \n                answers.append(answer)\n          \n            self.input_token_ids = np.array(input_token_ids_list).reshape(-1, self.max_article_length)\n            self.segment_ids = np.array(segment_ids_list).reshape(-1, self.max_article_length)\n            self.mask = np.array(mask_list).reshape(-1, self.max_article_length)\n            self.answers = np.array(answers)\n    \n        \n    def summary(self):\n        n = self.data.shape[0]\n        \n        no_long_no_short = 0\n        no_long = 0\n        no_short = 0\n        short_and_long = 0\n                \n        for i in range(n):\n            if self.data.iloc[i, :]['long_start'] == -1 and self.data.iloc[i, :]['short_start'] == -1:\n                no_long_no_short += 1\n            elif self.data.iloc[i, :]['long_start'] == -1 and self.data.iloc[i, :]['short_start'] != -1:\n                no_long += 1\n            elif self.data.iloc[i, :]['long_start'] != -1 and self.data.iloc[i, :]['short_start'] == -1:\n                no_short += 1\n            else:\n                short_and_long += 1\n            \n        print(\"Yes/No distribution: \", self.data['yes_no'].value_counts())\n        print(\"No short and no long: \", no_long_no_short / n)\n        print(\"No short but long: \", no_short / n)\n        print(\"No long but short: \", no_long / n)\n        print(\"Short and long: \", short_and_long / n)\n        \n    \n    def __getitem__(self, index):\n        return self.input_token_ids[index, :], self.segment_ids[index, :], self.mask[index, :], self.answers[index, :, :]\n\n    def __len__(self):\n        return self.input_token_ids.shape[0]\n        \n                ","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"a = WikiArticles(train_path, 100000)\na.download_data(10)\na.data.head()\na.process()\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"a.data","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"a[4]","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"class BERT_QA:\n    def __init__(self, config, num_hidden):\n        super(BERTQA, self).__init__()\n        self.bert = BertModel.from_pretrained('bert-base-uncased')\n        self.dropout = nn.Dropout(config.hidden_dropout_prob)\n        self.linear = nn.Linear(config.hidden_size, num_hidden)\n        self.tanh = nn.Tanh()\n        \n    def forward(self):\n        encoded_layers, pooled_output = self.bert(input_ids, token_type_ids, attention_mask, output_all_encoded_layers=False)\n        print(\"After BERT: \", pooled_output.shape)\n        pooled_output = self.dropout(pooled_output)\n        med1 = self.linear(pooled_output)\n        print(\"Atfer FC: \", med.shape)\n        output = self.tahn(med)\n        \n        return output\n    \n    def freeze_bert_encoder(self):\n        for param in self.bert.parameters():\n            param.requires_grad = False\n    \n    def unfreeze_bert_encoder(self):\n        for param in self.bert.parameters():\n            param.requires_grad = True\n        ","execution_count":null,"outputs":[]},{"metadata":{"_cell_guid":"","_uuid":"","trusted":true},"cell_type":"code","source":"import pandas as pd\nsample_submission = pd.read_csv(\"../input/tensorflow2-question-answering/sample_submission.csv\")","execution_count":0,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":1}