Pandabiblioteket gör pythonbaserad datavetenskap till en enkel resa. Det är ett populärt Python-bibliotek för att läsa, slå samman, sortera, rensa data och mer. Även om pandor är lätta att använda och applicera på datamängder, har den många datamanipulerande funktioner att lära sig.
Du kanske använder pandor, men det finns en god chans att du underutnyttjar den för att lösa datarelaterade problem. Här är vår lista över värdefulla data som manipulerar pandorfunktioner som alla dataforskare borde känna till.
Installera pandor i din virtuella miljö
Innan vi fortsätter, se till att du installerar pandor i din virtuella miljö med hjälp av pip:
pip install pandas
När du har installerat det, importera pandor överst i ditt manus, och låt oss fortsätta.
1. pandas.DataFrame
Du använder pandas.DataFrame() för att skapa en DataFrame i pandor. Det finns två sätt att använda den här funktionen.
Du kan skapa en DataFrame kolumnvis genom att skicka en ordbok till pandas.DataFrame() fungera. Här är varje nyckel en kolumn, medan värdena är raderna:
import pandas
DataFrame = pandas.DataFrame({"A" : [1, 3, 4], "B": [5, 9, 12]})
print(DataFrame)
Den andra metoden är att bilda DataFrame över rader. Men här ska du separera värdena (radobjekt) från kolumnerna. Antalet data i varje lista (raddata) måste också överensstämma med antalet kolumner.
import pandas
DataFrame = pandas.DataFrame([[1, 4, 5], [7, 19, 13]], columns= ["J", "K", "L"])
print(DataFrame)
2. Läs från och skriv till Excel eller CSV i pandor
Du kan läsa eller skriva till Excel- eller CSV-filer med pandor.
Läser Excel- eller CSV-filer
För att läsa en Excel-fil:
#Replace example.xlsx with the your Excel file path
DataFrame = DataFrame.read_excel("example.xlsx")
Så här läser du en CSV-fil:
#Replace example.csv with the your CSV file path
DataFrame = DataFrame.read_csv("example.csv")
Skriver till Excel eller CSV
Att skriva till Excel eller CSV är en välkänd pandaoperation. Och det är praktiskt för att spara nyligen beräknade tabeller i separata datablad.
Så här skriver du till ett Excel-ark:
DataFrame.to_excel("full_path_of_the_destination_folder/filename.xlsx")
Om du vill skriva till CSV:
DataFrame.to_csv("full_path_of_the_destination_folder/filename.csv")
Du kan också beräkna de centrala tendenserna för varje kolumn i en DataFrame med hjälp av pandor.
Så här får du medelvärdet för varje kolumn:
DataFrame.mean()
För median- eller lägesvärde, ersätt betyda() med median() eller läge().
4. DataFrame.transform
pandor DataFrame.transform() ändrar värdena för en DataFrame. Den accepterar en funktion som ett argument.
Till exempel multiplicerar koden nedan varje värde i en DataFrame med tre med Pythons lambda-funktion:
DataFrame = DataFrame.transform(lambda y: y*3)
print(DataFrame)
5. DataFrame.isnull
Denna funktion returnerar ett booleskt värde och flaggar alla rader som innehåller nollvärden som Sann:
DataFrame.isnull()
Resultatet av ovanstående kod kan vara svårt att läsa för större datamängder. Så du kan använda isnull().sum() funktion istället. Detta returnerar en sammanfattning av alla saknade värden för varje kolumn:
DataFrame.isnull().sum()
6. Dataframe.info
De info() funktion är en viktig pandaoperation. Den returnerar sammanfattningen av värden som inte saknas för varje kolumn istället:
DataFrame.info()
7. DataFrame.describe
De beskriva() funktionen ger dig sammanfattande statistik för en DataFrame:
DataFrame.describe()
8. DataFrame.replace
Använda DataFrame.replace() metod i pandor kan du ersätta valda rader med andra värden.
Till exempel att byta ogiltiga rader med Nan:
# Ensure that you pip install numpy for this to work
import numpy
import pandas
# Adding an inplace keyword and setting it to True makes the changes permanent:
DataFrame.replace([invalid_1, invalid_2], numpy.nan, inplace=True)
print(DataFrame)
9. DataFrame.fillna
Denna funktion låter dig fylla tomma rader med ett visst värde. Du kan fylla alla Nan rader i en datauppsättning med medelvärdet, till exempel:
DataFrame.fillna(df.mean(), inplace = True)
print(DataFrame)
Du kan också vara kolumnspecifik:
DataFrame['column_name'].fillna(df[column_name].mean(), inplace = True)
print(DataFrame)
10. DataFrame.dropna
De dropna() metod tar bort alla rader som innehåller nollvärden:
DataFrame.dropna(inplace = True)
print(DataFrame)
11. DataFrame.insert
Du kan använda pandor Föra in() funktion för att lägga till en ny kolumn i en DataFrame. Den accepterar tre nyckelord, den kolumnnamn, en lista över dess data och dess plats, som är ett kolumnindex.
Så här fungerar det:
DataFrame.insert(column = 'C', value = [3, 4, 6, 7], loc=0)
print(DataFrame)
Ovanstående kod infogar den nya kolumnen vid nollkolumnindex (det blir den första kolumnen).
12. DataFrame.loc
Du kan använda loc för att hitta elementen i ett visst index. För att se alla objekt på den tredje raden, till exempel:
DataFrame.loc[2]
13. DataFrame.pop
Denna funktion låter dig ta bort en specificerad kolumn från en pandas DataFrame.
Den accepterar en Artikel nyckelord, returnerar den poppade kolumnen och separerar den från resten av DataFrame:
DataFrame.pop(item= 'column_name')
print(DataFrame)
14. DataFrame.max, min
Att få maximala och lägsta värden med pandor är enkelt:
DataFrame.min()
Ovanstående kod returnerar minimivärdet för varje kolumn. För att få maximalt, byt ut min med max.
15. DataFrame.join
De Ansluta sig() funktion av pandas låter dig slå samman DataFrames med olika kolumnnamn. Du kan använda vänster, höger, inre eller yttre sammanfogning. För att gå med i en DataFrame med två andra:
#Left-join longer columns with shorter ones
newDataFrame = df1.join([df_shorter2, df_shorter3], how='left')
print(newDataFrame)
För att ansluta DataFrames med liknande kolumnnamn kan du skilja dem åt genom att inkludera ett suffix till vänster eller höger. Gör detta genom att inkludera lsuffix eller rsuffix nyckelord:
newDataFrame = df1.join([df2, rsuffix='_', how='outer')
print(newDataFrame)
16. DataFrame.combine
The combine() function comes in handy for merging two DataFrames containing similar column names based on set criteria. It accepts a function keyword.
For instance, to merge two DataFrames with similar column names based on the maximum values only:
newDataFrame = df.combine(df2, numpy.minimum)
print(newDataFrame)
Note: You can also define a custom selection function and insert numpy.minimum.
17. DataFrame.astype
The astype() function changes the data type of a particular column or DataFrame.
To change all values in a DataFrame to string, for instance:
DataFrame.astype(str)
18. DataFrame.sum
The sum() function in pandas returns the sum of the values in each column:
DataFrame.sum()
You can also find the cumulative sum of all items using cumsum():
DataFrame.cumsum()
19. DataFrame.drop
pandas’ drop() function deletes specific rows or columns in a DataFrame. You have to supply the column names or row index and an axis to use it.
To remove specific columns, for example:
df.drop(columns=['colum1', 'column2'], axel=0)
Så här släpper du rader på index 1, 3 och 4, till exempel:
df.drop([1, 3, 4], axis=0)
20. DataFrame.corr
Vill du hitta korrelationen mellan heltals- eller flytande kolumner? pandor kan hjälpa dig att uppnå det med hjälp av corr() fungera:
DataFrame.corr()
Ovanstående kod returnerar en ny DataFrame som innehåller korrelationssekvensen mellan alla heltals- eller flytande kolumner.
21. DataFrame.add
De Lägg till() funktionen låter dig lägga till ett specifikt nummer till varje värde i DataFrame. Det fungerar genom att iterera genom en DataFrame och arbeta på varje objekt.
För att lägga till 20 till vart och ett av värdena i en specifik kolumn som innehåller heltal eller flytande, till exempel:
DataFrame['interger_column'].add(20)
22. DataFrame.sub
Precis som additionsfunktionen kan du också subtrahera ett tal från varje värde i en DataFrame eller specifik kolumn:
DataFrame['interger_column'].sub(10)
23. DataFrame.mul
Detta är en multiplikationsversion av additionsfunktionen för pandor:
DataFrame['interger_column'].mul(20)
24. DataFrame.div
På samma sätt kan du dividera varje datapunkt i en kolumn eller DataFrame med ett specifikt nummer:
DataFrame['interger_column'].div(20)
25. DataFrame.std
Använda std() funktion låter pandas dig också beräkna standardavvikelsen för varje kolumn i en DataFrame. Det fungerar genom att iterera genom varje kolumn i en datauppsättning och beräkna standardavvikelsen för varje:
DataFrame.std()
26. DataFrame.sort_values
Du kan också sortera värden stigande eller fallande baserat på en viss kolumn. Så här sorterar du en DataFrame i fallande ordning, till exempel:
newDataFrame = DataFrame.sort_values(by = "colmun_name", descending = True)
27. DataFrame.melt
De smälta() funktion i pandor vänder kolumnerna i en DataFrame till enskilda rader. Det är som att exponera anatomin i en DataFrame. Så det låter dig visa värdet som tilldelats varje kolumn explicit.
newDataFrame = DataFrame.melt()
28. DataFrame.count
Denna funktion returnerar det totala antalet objekt i varje kolumn:
DataFrame.count()
29. DataFrame.query
pandor fråga() låter dig ringa objekt med deras indexnummer. För att få objekten i den tredje raden, till exempel:
DataFrame.query('4') # Call the query on the fourth index
30. DataFrame.where
De var() funktion är en pandafråga som accepterar ett villkor för att få specifika värden i en kolumn. Till exempel att få alla åldrar under 30 från en Ålder kolumn:
DataFrame.where(DataFrame['Age'] < 30)
Ovanstående kod matar ut en DataFrame som innehåller alla åldrar under 30 men tilldelar Nan till rader som inte uppfyller villkoret. .
Hantera data som ett proffs med pandor
pandas är en skattkammare av funktioner och metoder för att hantera små till storskaliga datamängder med Python. Biblioteket är också praktiskt för att rengöra, validera och förbereda data för analys eller maskininlärning.
Att ta sig tid att bemästra det gör definitivt ditt liv enklare som dataforskare, och det är väl värt ansträngningen. Så känn free att plocka upp alla funktioner du kan hantera.
Om författaren
Idowu Omisola (123 artiklar publicerade)
Idowu brinner för allt smart teknik och produktivitet. I hans free tid, han leker med kodning och byter till schackbrädet när han har tråkigt, men han älskar också att bryta sig loss från rutinen då och då. Hans passion för att visa människor vägen runt modern teknik motiverar honom att skriva mer.
Mer från Idowu Omisola
Prenumerera på vårt nyhetsbrev
Gå med i vårt nyhetsbrev för tekniska tips, recensioner, free e-böcker och exklusiva erbjudanden!
Klicka här för att prenumerera
