Skip to content

Commit cf3e65b

Browse files
committed
chore: ruff formatting
1 parent 4931cbb commit cf3e65b

38 files changed

Lines changed: 403 additions & 1223 deletions

delft/applications/citationClassifier.py

Lines changed: 4 additions & 12 deletions
Original file line numberDiff line numberDiff line change
@@ -56,9 +56,7 @@ def train(
5656
)
5757

5858
print("loading citation sentiment corpus...")
59-
xtr, y = load_citation_sentiment_corpus(
60-
"data/textClassification/citations/citation_sentiment_corpus.txt"
61-
)
59+
xtr, y = load_citation_sentiment_corpus("data/textClassification/citations/citation_sentiment_corpus.txt")
6260

6361
if fold_count == 1:
6462
model.train(xtr, y)
@@ -97,9 +95,7 @@ def train_and_eval(
9795
)
9896

9997
print("loading citation sentiment corpus...")
100-
xtr, y = load_citation_sentiment_corpus(
101-
"data/textClassification/citations/citation_sentiment_corpus.txt"
102-
)
98+
xtr, y = load_citation_sentiment_corpus("data/textClassification/citations/citation_sentiment_corpus.txt")
10399

104100
# segment train and eval sets
105101
x_train, y_train, x_test, y_test = split_data_and_labels(xtr, y, 0.9)
@@ -116,9 +112,7 @@ def train_and_eval(
116112

117113

118114
# classify a list of texts
119-
def classify(
120-
texts, output_format, architecture="gru", embeddings_name=None, transformer=None
121-
):
115+
def classify(texts, output_format, architecture="gru", embeddings_name=None, transformer=None):
122116
# load model
123117
model = Classifier(
124118
"citations_" + architecture,
@@ -139,9 +133,7 @@ def classify(
139133

140134

141135
if __name__ == "__main__":
142-
parser = argparse.ArgumentParser(
143-
description="Sentiment classification of citation contexts based on DeLFT"
144-
)
136+
parser = argparse.ArgumentParser(description="Sentiment classification of citation contexts based on DeLFT")
145137

146138
word_embeddings_examples = ["glove-840B", "fasttext-crawl", "word2vec"]
147139
pretrained_transformers_examples = [

delft/applications/dataseerClassifier.py

Lines changed: 25 additions & 77 deletions
Original file line numberDiff line numberDiff line change
@@ -72,9 +72,7 @@ def train(
7272
num_workers=None,
7373
):
7474
print("loading binary dataset type corpus...")
75-
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv(
76-
"data/textClassification/dataseer/all-binary.csv"
77-
)
75+
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/all-binary.csv")
7876

7977
model_name = "dataseer-binary_" + architecture
8078
class_weights = None
@@ -110,9 +108,7 @@ def train(
110108
model.save()
111109

112110
print("loading reuse dataset type corpus...")
113-
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv(
114-
"data/textClassification/dataseer/all-reuse.csv"
115-
)
111+
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/all-reuse.csv")
116112

117113
model_name = "dataseer-reuse_" + architecture
118114
class_weights = {0: 1.5, 1: 1.0}
@@ -143,9 +139,7 @@ def train(
143139
model.save()
144140

145141
print("loading first-level dataset type corpus...")
146-
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv(
147-
"data/textClassification/dataseer/all-multilevel.csv"
148-
)
142+
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/all-multilevel.csv")
149143

150144
model_name = "dataseer-first_" + architecture
151145

@@ -233,9 +227,7 @@ def train_and_eval(
233227
)
234228

235229
# classifier for deciding if we have a dataset or not in a sentence
236-
train_and_eval_binary(
237-
embeddings_name, fold_count, architecture=architecture, transformer=transformer
238-
)
230+
train_and_eval_binary(embeddings_name, fold_count, architecture=architecture, transformer=transformer)
239231

240232
# classifier for deciding if the introduced dataset is a reuse of an existing one or is a new dataset
241233
# train_and_eval_reuse(embeddings_name, fold_count, architecture=architecture, transformer=transformer)
@@ -247,14 +239,10 @@ def train_and_eval(
247239
# train_and_eval_secondary(embeddings_name, fold_count, architecture=architecture, transformer=transformer)
248240

249241

250-
def train_and_eval_binary(
251-
embeddings_name, fold_count, architecture="gru", transformer=None
252-
):
242+
def train_and_eval_binary(embeddings_name, fold_count, architecture="gru", transformer=None):
253243
print("loading dataset type corpus...")
254244
# xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/all-binary.csv")
255-
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv(
256-
"data/textClassification/dataseer/phase1-2-binary.csv"
257-
)
245+
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/phase1-2-binary.csv")
258246
# xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/phase3-binary.csv")
259247

260248
# distinct values of classes
@@ -266,9 +254,7 @@ def train_and_eval_binary(
266254

267255
class_weights = None
268256

269-
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(
270-
architecture
271-
)
257+
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(architecture)
272258

273259
model = Classifier(
274260
"dataseer-binary_" + architecture,
@@ -321,13 +307,9 @@ def train_and_eval_binary(
321307
model.save()
322308

323309

324-
def train_and_eval_reuse(
325-
embeddings_name, fold_count, architecture="gru", transformer=None
326-
):
310+
def train_and_eval_reuse(embeddings_name, fold_count, architecture="gru", transformer=None):
327311
print("loading dataset type corpus...")
328-
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv(
329-
"data/textClassification/dataseer/all-reuse.csv"
330-
)
312+
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/all-reuse.csv")
331313

332314
# distinct values of classes
333315
print(list_classes)
@@ -336,9 +318,7 @@ def train_and_eval_reuse(
336318
print(len(xtr), "texts")
337319
print(len(y), "classes")
338320

339-
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(
340-
architecture
341-
)
321+
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(architecture)
342322

343323
class_weights = {0: 1.5, 1: 1.0}
344324

@@ -378,13 +358,9 @@ def train_and_eval_reuse(
378358
model.save()
379359

380360

381-
def train_and_eval_primary(
382-
embeddings_name, fold_count, architecture="gru", transformer=None
383-
):
361+
def train_and_eval_primary(embeddings_name, fold_count, architecture="gru", transformer=None):
384362
print("loading dataset type corpus...")
385-
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv(
386-
"data/textClassification/dataseer/all-multilevel.csv"
387-
)
363+
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/all-multilevel.csv")
388364

389365
# distinct values of classes
390366
print(list_classes)
@@ -394,9 +370,7 @@ def train_and_eval_primary(
394370
print(len(y), "classes")
395371

396372
class_weights = None
397-
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(
398-
architecture
399-
)
373+
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(architecture)
400374

401375
model = Classifier(
402376
"dataseer-first_" + architecture,
@@ -434,9 +408,7 @@ def train_and_eval_primary(
434408
model.save()
435409

436410

437-
def train_and_eval_secondary(
438-
embeddings_name, fold_count, architecture="gru", transformer=None
439-
):
411+
def train_and_eval_secondary(embeddings_name, fold_count, architecture="gru", transformer=None):
440412
print("training second-level dataset subtype corpus...")
441413
xtr, y1, y2, _, list_classes, list_subclasses, _ = load_dataseer_corpus_csv(
442414
"data/textClassification/dataseer/all-multilevel.csv"
@@ -449,9 +421,7 @@ def train_and_eval_secondary(
449421
print(len(list_subclasses), "sub-classes")
450422

451423
class_weights = None
452-
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(
453-
architecture
454-
)
424+
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(architecture)
455425

456426
datatypes_y = {}
457427
datatypes_xtr = {}
@@ -489,10 +459,7 @@ def train_and_eval_secondary(
489459
print("only one subclass for", the_class)
490460
continue
491461

492-
if (
493-
len(datatypes_list_subclasses[the_class]) == 2
494-
and "nan" in datatypes_list_subclasses[the_class]
495-
):
462+
if len(datatypes_list_subclasses[the_class]) == 2 and "nan" in datatypes_list_subclasses[the_class]:
496463
continue
497464

498465
if the_class == "Protein Data":
@@ -523,9 +490,7 @@ def train_and_eval_secondary(
523490
local_y = []
524491
for the_y in datatypes_y[the_class]:
525492
the_ind = datatypes_list_subclasses[the_class].index(the_y)
526-
local_y.append(
527-
vectorizer(the_ind, len(datatypes_list_subclasses[the_class]))
528-
)
493+
local_y.append(vectorizer(the_ind, len(datatypes_list_subclasses[the_class])))
529494

530495
# segment train and eval sets
531496
x_train, y_train, x_test, y_test = split_data_and_labels(
@@ -558,19 +523,13 @@ def classify(texts, output_format, architecture="gru"):
558523
return result
559524

560525

561-
def train_eval_cascaded(
562-
embeddings_name, fold_count, architecture="gru", transformer=None
563-
):
526+
def train_eval_cascaded(embeddings_name, fold_count, architecture="gru", transformer=None):
564527
# general setting of parameters
565528
class_weights = None
566-
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(
567-
architecture
568-
)
529+
batch_size, maxlen, patience, early_stop, max_epoch, learning_rate = configure(architecture)
569530

570531
# first binary classifier: dataset or no_dataset
571-
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv(
572-
"data/textClassification/dataseer/all-binary.csv"
573-
)
532+
xtr, y, _, _, list_classes, _, _ = load_dataseer_corpus_csv("data/textClassification/dataseer/all-binary.csv")
574533

575534
print(list_classes)
576535

@@ -662,9 +621,7 @@ def vectorize(index, size):
662621
result[index] = 1
663622
return result
664623

665-
result_binary = np.array(
666-
[vectorize(xi, len(list_classes)) for xi in result_intermediate]
667-
)
624+
result_binary = np.array([vectorize(xi, len(list_classes)) for xi in result_intermediate])
668625

669626

670627
def filter_exclude_class(xtr, y_classes, the_class):
@@ -728,13 +685,8 @@ def build_prior_class_distribution():
728685
the_leafclass = list_leaf_classes[pos_leafclass[0][0]]
729686
print(distribution[the_class][the_subclass][the_leafclass])
730687
if "count" in distribution[the_class][the_subclass][the_leafclass]:
731-
distribution[the_class][the_subclass][the_leafclass][
732-
"count"
733-
] = (
734-
distribution[the_class][the_subclass][the_leafclass][
735-
"count"
736-
]
737-
+ 1
688+
distribution[the_class][the_subclass][the_leafclass]["count"] = (
689+
distribution[the_class][the_subclass][the_leafclass]["count"] + 1
738690
)
739691
else:
740692
if "count" in distribution[the_class][the_subclass]:
@@ -743,14 +695,10 @@ def build_prior_class_distribution():
743695
)
744696
else:
745697
if "count" in distribution[the_class]:
746-
distribution[the_class]["count"] = (
747-
distribution[the_class]["count"] + 1
748-
)
698+
distribution[the_class]["count"] = distribution[the_class]["count"] + 1
749699

750700
# save the extended json
751-
with open(
752-
"data/textClassification/dataseer/DataTypesWithCounts.json", "w"
753-
) as outfile:
701+
with open("data/textClassification/dataseer/DataTypesWithCounts.json", "w") as outfile:
754702
json.dump(distribution, outfile, sort_keys=False, indent=4)
755703

756704

0 commit comments

Comments
 (0)