@@ -72,9 +72,7 @@ def train(
7272 num_workers = None ,
7373):
7474 print ("loading binary dataset type corpus..." )
75- xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv (
76- "data/textClassification/dataseer/all-binary.csv"
77- )
75+ xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv ("data/textClassification/dataseer/all-binary.csv" )
7876
7977 model_name = "dataseer-binary_" + architecture
8078 class_weights = None
@@ -110,9 +108,7 @@ def train(
110108 model .save ()
111109
112110 print ("loading reuse dataset type corpus..." )
113- xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv (
114- "data/textClassification/dataseer/all-reuse.csv"
115- )
111+ xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv ("data/textClassification/dataseer/all-reuse.csv" )
116112
117113 model_name = "dataseer-reuse_" + architecture
118114 class_weights = {0 : 1.5 , 1 : 1.0 }
@@ -143,9 +139,7 @@ def train(
143139 model .save ()
144140
145141 print ("loading first-level dataset type corpus..." )
146- xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv (
147- "data/textClassification/dataseer/all-multilevel.csv"
148- )
142+ xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv ("data/textClassification/dataseer/all-multilevel.csv" )
149143
150144 model_name = "dataseer-first_" + architecture
151145
@@ -233,9 +227,7 @@ def train_and_eval(
233227 )
234228
235229 # classifier for deciding if we have a dataset or not in a sentence
236- train_and_eval_binary (
237- embeddings_name , fold_count , architecture = architecture , transformer = transformer
238- )
230+ train_and_eval_binary (embeddings_name , fold_count , architecture = architecture , transformer = transformer )
239231
240232 # classifier for deciding if the introduced dataset is a reuse of an existing one or is a new dataset
241233 # train_and_eval_reuse(embeddings_name, fold_count, architecture=architecture, transformer=transformer)
@@ -247,14 +239,10 @@ def train_and_eval(
247239 # train_and_eval_secondary(embeddings_name, fold_count, architecture=architecture, transformer=transformer)
248240
249241
250- def train_and_eval_binary (
251- embeddings_name , fold_count , architecture = "gru" , transformer = None
252- ):
242+ def train_and_eval_binary (embeddings_name , fold_count , architecture = "gru" , transformer = None ):
253243 print ("loading dataset type corpus..." )
254244 # xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/all-binary.csv")
255- xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv (
256- "data/textClassification/dataseer/phase1-2-binary.csv"
257- )
245+ xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv ("data/textClassification/dataseer/phase1-2-binary.csv" )
258246 # xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/phase3-binary.csv")
259247
260248 # distinct values of classes
@@ -266,9 +254,7 @@ def train_and_eval_binary(
266254
267255 class_weights = None
268256
269- batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (
270- architecture
271- )
257+ batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (architecture )
272258
273259 model = Classifier (
274260 "dataseer-binary_" + architecture ,
@@ -321,13 +307,9 @@ def train_and_eval_binary(
321307 model .save ()
322308
323309
324- def train_and_eval_reuse (
325- embeddings_name , fold_count , architecture = "gru" , transformer = None
326- ):
310+ def train_and_eval_reuse (embeddings_name , fold_count , architecture = "gru" , transformer = None ):
327311 print ("loading dataset type corpus..." )
328- xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv (
329- "data/textClassification/dataseer/all-reuse.csv"
330- )
312+ xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv ("data/textClassification/dataseer/all-reuse.csv" )
331313
332314 # distinct values of classes
333315 print (list_classes )
@@ -336,9 +318,7 @@ def train_and_eval_reuse(
336318 print (len (xtr ), "texts" )
337319 print (len (y ), "classes" )
338320
339- batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (
340- architecture
341- )
321+ batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (architecture )
342322
343323 class_weights = {0 : 1.5 , 1 : 1.0 }
344324
@@ -378,13 +358,9 @@ def train_and_eval_reuse(
378358 model .save ()
379359
380360
381- def train_and_eval_primary (
382- embeddings_name , fold_count , architecture = "gru" , transformer = None
383- ):
361+ def train_and_eval_primary (embeddings_name , fold_count , architecture = "gru" , transformer = None ):
384362 print ("loading dataset type corpus..." )
385- xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv (
386- "data/textClassification/dataseer/all-multilevel.csv"
387- )
363+ xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv ("data/textClassification/dataseer/all-multilevel.csv" )
388364
389365 # distinct values of classes
390366 print (list_classes )
@@ -394,9 +370,7 @@ def train_and_eval_primary(
394370 print (len (y ), "classes" )
395371
396372 class_weights = None
397- batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (
398- architecture
399- )
373+ batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (architecture )
400374
401375 model = Classifier (
402376 "dataseer-first_" + architecture ,
@@ -434,9 +408,7 @@ def train_and_eval_primary(
434408 model .save ()
435409
436410
437- def train_and_eval_secondary (
438- embeddings_name , fold_count , architecture = "gru" , transformer = None
439- ):
411+ def train_and_eval_secondary (embeddings_name , fold_count , architecture = "gru" , transformer = None ):
440412 print ("training second-level dataset subtype corpus..." )
441413 xtr , y1 , y2 , _ , list_classes , list_subclasses , _ = load_dataseer_corpus_csv (
442414 "data/textClassification/dataseer/all-multilevel.csv"
@@ -449,9 +421,7 @@ def train_and_eval_secondary(
449421 print (len (list_subclasses ), "sub-classes" )
450422
451423 class_weights = None
452- batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (
453- architecture
454- )
424+ batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (architecture )
455425
456426 datatypes_y = {}
457427 datatypes_xtr = {}
@@ -489,10 +459,7 @@ def train_and_eval_secondary(
489459 print ("only one subclass for" , the_class )
490460 continue
491461
492- if (
493- len (datatypes_list_subclasses [the_class ]) == 2
494- and "nan" in datatypes_list_subclasses [the_class ]
495- ):
462+ if len (datatypes_list_subclasses [the_class ]) == 2 and "nan" in datatypes_list_subclasses [the_class ]:
496463 continue
497464
498465 if the_class == "Protein Data" :
@@ -523,9 +490,7 @@ def train_and_eval_secondary(
523490 local_y = []
524491 for the_y in datatypes_y [the_class ]:
525492 the_ind = datatypes_list_subclasses [the_class ].index (the_y )
526- local_y .append (
527- vectorizer (the_ind , len (datatypes_list_subclasses [the_class ]))
528- )
493+ local_y .append (vectorizer (the_ind , len (datatypes_list_subclasses [the_class ])))
529494
530495 # segment train and eval sets
531496 x_train , y_train , x_test , y_test = split_data_and_labels (
@@ -558,19 +523,13 @@ def classify(texts, output_format, architecture="gru"):
558523 return result
559524
560525
561- def train_eval_cascaded (
562- embeddings_name , fold_count , architecture = "gru" , transformer = None
563- ):
526+ def train_eval_cascaded (embeddings_name , fold_count , architecture = "gru" , transformer = None ):
564527 # general setting of parameters
565528 class_weights = None
566- batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (
567- architecture
568- )
529+ batch_size , maxlen , patience , early_stop , max_epoch , learning_rate = configure (architecture )
569530
570531 # first binary classifier: dataset or no_dataset
571- xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv (
572- "data/textClassification/dataseer/all-binary.csv"
573- )
532+ xtr , y , _ , _ , list_classes , _ , _ = load_dataseer_corpus_csv ("data/textClassification/dataseer/all-binary.csv" )
574533
575534 print (list_classes )
576535
@@ -662,9 +621,7 @@ def vectorize(index, size):
662621 result [index ] = 1
663622 return result
664623
665- result_binary = np .array (
666- [vectorize (xi , len (list_classes )) for xi in result_intermediate ]
667- )
624+ result_binary = np .array ([vectorize (xi , len (list_classes )) for xi in result_intermediate ])
668625
669626
670627def filter_exclude_class (xtr , y_classes , the_class ):
@@ -728,13 +685,8 @@ def build_prior_class_distribution():
728685 the_leafclass = list_leaf_classes [pos_leafclass [0 ][0 ]]
729686 print (distribution [the_class ][the_subclass ][the_leafclass ])
730687 if "count" in distribution [the_class ][the_subclass ][the_leafclass ]:
731- distribution [the_class ][the_subclass ][the_leafclass ][
732- "count"
733- ] = (
734- distribution [the_class ][the_subclass ][the_leafclass ][
735- "count"
736- ]
737- + 1
688+ distribution [the_class ][the_subclass ][the_leafclass ]["count" ] = (
689+ distribution [the_class ][the_subclass ][the_leafclass ]["count" ] + 1
738690 )
739691 else :
740692 if "count" in distribution [the_class ][the_subclass ]:
@@ -743,14 +695,10 @@ def build_prior_class_distribution():
743695 )
744696 else :
745697 if "count" in distribution [the_class ]:
746- distribution [the_class ]["count" ] = (
747- distribution [the_class ]["count" ] + 1
748- )
698+ distribution [the_class ]["count" ] = distribution [the_class ]["count" ] + 1
749699
750700 # save the extended json
751- with open (
752- "data/textClassification/dataseer/DataTypesWithCounts.json" , "w"
753- ) as outfile :
701+ with open ("data/textClassification/dataseer/DataTypesWithCounts.json" , "w" ) as outfile :
754702 json .dump (distribution , outfile , sort_keys = False , indent = 4 )
755703
756704
0 commit comments