Nyheter i Android, Telefoner, Prylar Och Recensioner

30 pandor kommandon för att manipulera dataramar

Pandabiblioteket gör pythonbaserad datavetenskap till en enkel resa. Det är ett populärt Python-bibliotek för att läsa, slå samman, sortera, rensa data och mer. Även om pandor är lätta att använda och applicera på datamängder, har den många datamanipulerande funktioner att lära sig.

Du kanske använder pandor, men det finns en god chans att du underutnyttjar den för att lösa datarelaterade problem. Här är vår lista över värdefulla data som manipulerar pandorfunktioner som alla dataforskare borde känna till.

Installera pandor i din virtuella miljö

Innan vi fortsätter, se till att du installerar pandor i din virtuella miljö med hjälp av pip:

pip install pandas

När du har installerat det, importera pandor överst i ditt manus, och låt oss fortsätta.

1. pandas.DataFrame

Du använder pandas.DataFrame() för att skapa en DataFrame i pandor. Det finns två sätt att använda den här funktionen.

Du kan skapa en DataFrame kolumnvis genom att skicka en ordbok till pandas.DataFrame() fungera. Här är varje nyckel en kolumn, medan värdena är raderna:

import pandas
DataFrame = pandas.DataFrame({"A" : [1, 3, 4], "B": [5, 9, 12]})
print(DataFrame)

Den andra metoden är att bilda DataFrame över rader. Men här ska du separera värdena (radobjekt) från kolumnerna. Antalet data i varje lista (raddata) måste också överensstämma med antalet kolumner.

import pandas
DataFrame = pandas.DataFrame([[1, 4, 5], [7, 19, 13]], columns= ["J", "K", "L"])
print(DataFrame)

2. Läs från och skriv till Excel eller CSV i pandor

Du kan läsa eller skriva till Excel- eller CSV-filer med pandor.

Läser Excel- eller CSV-filer

För att läsa en Excel-fil:

#Replace example.xlsx with the your Excel file path 
DataFrame = DataFrame.read_excel("example.xlsx")

Så här läser du en CSV-fil:

#Replace example.csv with the your CSV file path 
DataFrame = DataFrame.read_csv("example.csv")

Skriver till Excel eller CSV

Att skriva till Excel eller CSV är en välkänd pandaoperation. Och det är praktiskt för att spara nyligen beräknade tabeller i separata datablad.

Så här skriver du till ett Excel-ark:

DataFrame.to_excel("full_path_of_the_destination_folder/filename.xlsx")

Om du vill skriva till CSV:

DataFrame.to_csv("full_path_of_the_destination_folder/filename.csv")

Du kan också beräkna de centrala tendenserna för varje kolumn i en DataFrame med hjälp av pandor.

Så här får du medelvärdet för varje kolumn:

DataFrame.mean()

För median- eller lägesvärde, ersätt betyda() med median() eller läge().

4. DataFrame.transform

pandor DataFrame.transform() ändrar värdena för en DataFrame. Den accepterar en funktion som ett argument.

Till exempel multiplicerar koden nedan varje värde i en DataFrame med tre med Pythons lambda-funktion:

DataFrame = DataFrame.transform(lambda y: y*3)
print(DataFrame)

5. DataFrame.isnull

Denna funktion returnerar ett booleskt värde och flaggar alla rader som innehåller nollvärden som Sann:

DataFrame.isnull()

Resultatet av ovanstående kod kan vara svårt att läsa för större datamängder. Så du kan använda isnull().sum() funktion istället. Detta returnerar en sammanfattning av alla saknade värden för varje kolumn:

DataFrame.isnull().sum()

6. Dataframe.info

De info() funktion är en viktig pandaoperation. Den returnerar sammanfattningen av värden som inte saknas för varje kolumn istället:

DataFrame.info()

7. DataFrame.describe

De beskriva() funktionen ger dig sammanfattande statistik för en DataFrame:

DataFrame.describe()

8. DataFrame.replace

Använda DataFrame.replace() metod i pandor kan du ersätta valda rader med andra värden.

Relaterad  Marvel: Avengers, X-Men och Eternals kommer att ha en crossover 2022?

Till exempel att byta ogiltiga rader med Nan:

# Ensure that you pip install numpy for this to work 
import numpy
import pandas
# Adding an inplace keyword and setting it to True makes the changes permanent:
DataFrame.replace([invalid_1, invalid_2], numpy.nan, inplace=True)
print(DataFrame)

9. DataFrame.fillna

Denna funktion låter dig fylla tomma rader med ett visst värde. Du kan fylla alla Nan rader i en datauppsättning med medelvärdet, till exempel:

DataFrame.fillna(df.mean(), inplace = True)
print(DataFrame)

Du kan också vara kolumnspecifik:

DataFrame['column_name'].fillna(df[column_name].mean(), inplace = True)
print(DataFrame)

10. DataFrame.dropna

De dropna() metod tar bort alla rader som innehåller nollvärden:

DataFrame.dropna(inplace = True)
print(DataFrame)

11. DataFrame.insert

Du kan använda pandor Föra in() funktion för att lägga till en ny kolumn i en DataFrame. Den accepterar tre nyckelord, den kolumnnamn, en lista över dess data och dess plats, som är ett kolumnindex.

Så här fungerar det:

DataFrame.insert(column = 'C', value = [3, 4, 6, 7], loc=0)
print(DataFrame)

Ovanstående kod infogar den nya kolumnen vid nollkolumnindex (det blir den första kolumnen).

12. DataFrame.loc

Du kan använda loc för att hitta elementen i ett visst index. För att se alla objekt på den tredje raden, till exempel:

DataFrame.loc[2]

13. DataFrame.pop

Denna funktion låter dig ta bort en specificerad kolumn från en pandas DataFrame.

Den accepterar en Artikel nyckelord, returnerar den poppade kolumnen och separerar den från resten av DataFrame:

DataFrame.pop(item= 'column_name')
print(DataFrame)

14. DataFrame.max, min

Att få maximala och lägsta värden med pandor är enkelt:

DataFrame.min()

Ovanstående kod returnerar minimivärdet för varje kolumn. För att få maximalt, byt ut min med max.

15. DataFrame.join

De Ansluta sig() funktion av pandas låter dig slå samman DataFrames med olika kolumnnamn. Du kan använda vänster, höger, inre eller yttre sammanfogning. För att gå med i en DataFrame med två andra:

#Left-join longer columns with shorter ones
newDataFrame = df1.join([df_shorter2, df_shorter3], how='left')
print(newDataFrame)

För att ansluta DataFrames med liknande kolumnnamn kan du skilja dem åt genom att inkludera ett suffix till vänster eller höger. Gör detta genom att inkludera lsuffix eller rsuffix nyckelord:

newDataFrame = df1.join([df2, rsuffix='_', how='outer') 
print(newDataFrame)

16. DataFrame.combine

The combine() function comes in handy for merging two DataFrames containing similar column names based on set criteria. It accepts a function keyword.

Relaterad  10 sätt att använda Elgato Stream Deck för att hjälpa din produktivitet

For instance, to merge two DataFrames with similar column names based on the maximum values only:

newDataFrame = df.combine(df2, numpy.minimum)
print(newDataFrame)

Note: You can also define a custom selection function and insert numpy.minimum.

17. DataFrame.astype

The astype() function changes the data type of a particular column or DataFrame.

To change all values in a DataFrame to string, for instance:

DataFrame.astype(str)

18. DataFrame.sum

The sum() function in pandas returns the sum of the values in each column:

DataFrame.sum()

You can also find the cumulative sum of all items using cumsum():

DataFrame.cumsum()

19. DataFrame.drop

pandas’ drop() function deletes specific rows or columns in a DataFrame. You have to supply the column names or row index and an axis to use it.

To remove specific columns, for example:

df.drop(columns=['colum1', 'column2'], axel=0)

Så här släpper du rader på index 1, 3 och 4, till exempel:

df.drop([1, 3, 4], axis=0)

20. DataFrame.corr

Vill du hitta korrelationen mellan heltals- eller flytande kolumner? pandor kan hjälpa dig att uppnå det med hjälp av corr() fungera:

DataFrame.corr()

Ovanstående kod returnerar en ny DataFrame som innehåller korrelationssekvensen mellan alla heltals- eller flytande kolumner.

21. DataFrame.add

De Lägg till() funktionen låter dig lägga till ett specifikt nummer till varje värde i DataFrame. Det fungerar genom att iterera genom en DataFrame och arbeta på varje objekt.

För att lägga till 20 till vart och ett av värdena i en specifik kolumn som innehåller heltal eller flytande, till exempel:

DataFrame['interger_column'].add(20)

22. DataFrame.sub

Precis som additionsfunktionen kan du också subtrahera ett tal från varje värde i en DataFrame eller specifik kolumn:

DataFrame['interger_column'].sub(10)

23. DataFrame.mul

Detta är en multiplikationsversion av additionsfunktionen för pandor:

DataFrame['interger_column'].mul(20)

24. DataFrame.div

På samma sätt kan du dividera varje datapunkt i en kolumn eller DataFrame med ett specifikt nummer:

DataFrame['interger_column'].div(20)

25. DataFrame.std

Använda std() funktion låter pandas dig också beräkna standardavvikelsen för varje kolumn i en DataFrame. Det fungerar genom att iterera genom varje kolumn i en datauppsättning och beräkna standardavvikelsen för varje:

DataFrame.std()

26. DataFrame.sort_values

Du kan också sortera värden stigande eller fallande baserat på en viss kolumn. Så här sorterar du en DataFrame i fallande ordning, till exempel:

newDataFrame = DataFrame.sort_values(by = "colmun_name", descending = True)

27. DataFrame.melt

De smälta() funktion i pandor vänder kolumnerna i en DataFrame till enskilda rader. Det är som att exponera anatomin i en DataFrame. Så det låter dig visa värdet som tilldelats varje kolumn explicit.

newDataFrame = DataFrame.melt()

28. DataFrame.count

Denna funktion returnerar det totala antalet objekt i varje kolumn:

DataFrame.count()

29. DataFrame.query

pandor fråga() låter dig ringa objekt med deras indexnummer. För att få objekten i den tredje raden, till exempel:

DataFrame.query('4') # Call the query on the fourth index 

30. DataFrame.where

De var() funktion är en pandafråga som accepterar ett villkor för att få specifika värden i en kolumn. Till exempel att få alla åldrar under 30 från en Ålder kolumn:

DataFrame.where(DataFrame['Age'] < 30)

Ovanstående kod matar ut en DataFrame som innehåller alla åldrar under 30 men tilldelar Nan till rader som inte uppfyller villkoret. .

Relaterad  Destiny 2 – The Witch Queen: Ny trailer sätter stämningen för expansionen

Hantera data som ett proffs med pandor

pandas är en skattkammare av funktioner och metoder för att hantera små till storskaliga datamängder med Python. Biblioteket är också praktiskt för att rengöra, validera och förbereda data för analys eller maskininlärning.

Att ta sig tid att bemästra det gör definitivt ditt liv enklare som dataforskare, och det är väl värt ansträngningen. Så känn free att plocka upp alla funktioner du kan hantera.

Om författaren

Idowu Omisola (123 artiklar publicerade)

Idowu brinner för allt smart teknik och produktivitet. I hans free tid, han leker med kodning och byter till schackbrädet när han har tråkigt, men han älskar också att bryta sig loss från rutinen då och då. Hans passion för att visa människor vägen runt modern teknik motiverar honom att skriva mer.

Mer från Idowu Omisola

Prenumerera på vårt nyhetsbrev

Gå med i vårt nyhetsbrev för tekniska tips, recensioner, free e-böcker och exklusiva erbjudanden!

Klicka här för att prenumerera