Load Single Model Dataset | Score dataset using bank marking data | Teradata Open Analytics Framework - Load the Dataset and Prepare for Training - Teradata VantageCloud Lake

Lake - Analyze Your Data with ClearScape Analytics™

Deployment
VantageCloud
Edition
Lake
Product
Teradata VantageCloud Lake
Release Number
Published
February 2025
ft:locale
en-US
ft:lastEdition
2026-02-20
dita:mapPath
tcl1683670667798.ditamap
dita:ditavalPath
pny1626732985837.ditaval
dita:id
tcl1683670667798
  1. Load the dataset from example collection.
    load_example_data('teradataml','bank_marketing')
    bank_df = DataFrame("bank_marketing")
    bank_df

    Out:

    bank_df
    age 	job 	marital 	education 	default_value 	balance 	housing 	loan 	contact 	day_of_month 	month_of_year 	duration 	campaign 	pdays 	previous 	poutcome 	deposit
    45 	admin. 	married 	secondary 	no 	149 	yes 	no 	unknown 	23 	may 	893 	3 	-1 	0 	unknown 	yes
    45 	blue-collar 	divorced 	primary 	no 	594 	yes 	no 	unknown 	29 	may 	833 	2 	-1 	0 	unknown 	yes
    45 	technician 	single 	secondary 	no 	410 	yes 	no 	unknown 	30 	may 	891 	4 	-1 	0 	unknown 	yes
    45 	management 	divorced 	secondary 	no 	644 	yes 	no 	unknown 	4 	jun 	633 	1 	-1 	0 	unknown 	yes
    45 	management 	married 	tertiary 	no 	655 	no 	no 	unknown 	20 	jun 	693 	3 	-1 	0 	unknown 	yes
    45 	technician 	married 	secondary 	no 	879 	no 	no 	cellular 	7 	jul 	621 	2 	-1 	0 	unknown 	yes
    45 	blue-collar 	divorced 	primary 	no 	844 	no 	no 	unknown 	5 	jun 	1018 	3 	-1 	0 	unknown 	yes
    45 	unemployed 	divorced 	secondary 	no 	3354 	yes 	no 	unknown 	29 	may 	746 	1 	-1 	0 	unknown 	yes
    45 	blue-collar 	divorced 	primary 	no 	-311 	yes 	no 	unknown 	23 	may 	1030 	1 	-1 	0 	unknown 	yes
    45 	entrepreneur 	divorced 	tertiary 	no 	-395 	yes 	no 	unknown 	13 	may 	470 	1 	-1 	0 	unknown 	yes
  2. Add a partition column to create a single model with all data
    new_partition_columns = ["partition_column_1"]
    bank_df = bank_df.assign(**{new_partition_columns[0]: 1001})
  3. Create test and train data using Teradata's in-database functions.
    bank_df_sample = bank_df.sample(frac = [0.8, 0.2])
    bank_df_train= bank_df_sample[bank_df_sample['sampleid'] == 1].drop('sampleid', axis=1)
    bank_df_test = bank_df_sample[bank_df_sample['sampleid'] == 2].drop('sampleid', axis=1)
  4. Train the data shape.
    bank_df_train.shape

    Out:

    (8930, 18)
  5. Test the data shape.
    bank_df_test.shape

    Out:

    (2232, 18)