Pivot da formato largo a lungo e quindi nidificazione delle colonne

Jan 04 2021

Mi vengono forniti dati in un formato ampio. Ogni riga riguarda una variabile esterna alla tabella corrente e i possibili valori rilevanti per quella variabile. Sto cercando di: (1) eseguire il pivot nel formato lungo e (2) annidare i valori pivot.

Esempio

library(tibble)

df_1 <-
  tribble(~key, ~values.male, ~values.female, ~values.red, ~values.green, ~value,
        "gender", 0.5, 0.5, NA, NA, NA,
        "age", NA, NA, NA, NA, "50",
        "color", NA, NA, TRUE, FALSE, NA,
        "time_of_day", NA, NA, NA, NA, "noon")

## # A tibble: 4 x 6
##   key         values.male values.female values.red values.green value
##   <chr>             <dbl>         <dbl> <lgl>      <lgl>        <chr>
## 1 gender              0.5           0.5 NA         NA           NA   
## 2 age                NA            NA   NA         NA           50   
## 3 color              NA            NA   TRUE       FALSE        NA   
## 4 time_of_day        NA            NA   NA         NA           noon

In questo esempio, vediamo che genderpuò avere uno female = 0.5e male = 0.5. D'altra parte, agepuò avere un solo valore di 50. Dalla riga # 3 apprendiamo che colorpuò avere valori di red = TRUEe green = FALSE, e time_of_day = noon.

Pertanto, una tabella pivot dovrebbe assumere la forma nidificata di:

my_pivoted_df <-
  structure(
    list(
      var_name = c("gender", "age", "color", "time_of_day"),
      vals = list(
        structure(
          list(
            level = c("male", "female"),
            value = c(0.5,
                      0.5)
          ),
          row.names = c(NA, -2L),
          class = c("tbl_df", "tbl", "data.frame")
        ),
        "50",
        structure(
          list(
            level = c("red", "green"),
            value = c(TRUE,
                      FALSE)
          ),
          row.names = c(NA, -2L),
          class = c("tbl_df", "tbl", "data.frame")
        ),
        "noon"
      )
    ),
    row.names = c(NA, -4L),
    class = c("tbl_df", "tbl",
              "data.frame")
  )


## # A tibble: 4 x 2
##   var_name    vals            
##   <chr>       <list>          
## 1 gender      <tibble [2 x 2]>
## 2 age         <chr [1]>       
## 3 color       <tibble [2 x 2]>
## 4 time_of_day <chr [1]>

Il mio tentativo di risolverlo

Ci sono un paio di problemi con df_1. Innanzitutto, l'attuale denominazione delle colonne è scomoda. Intestazioni come valuenon sono ideali perché sono in conflitto con pivot_longer()il ".value"meccanismo di. Secondo, df_1ha values(al plurale) quando keyha più di un'opzione (ad esempio, "rosso" e "verde" per color), ma value(singolare) quando c'è solo un'opzione per key(come con age). Di seguito è riportato il mio codice non riuscito, ispirato a questa risposta .

library(tidyr)
library(dplyr)

df_1 %>%
  rename_with( ~ paste(.x, "single", sep = "."), .cols = value) %>% ## changed the header because otherwise it breaks
  pivot_longer(cols = starts_with("val"),
               names_to = c("whatevs", ".value"), names_sep = "\\.")


## # A tibble: 8 x 7
##   key         whatevs  male female red   green single
##   <chr>       <chr>   <dbl>  <dbl> <lgl> <lgl> <chr> 
## 1 gender      values    0.5    0.5 NA    NA    NA    
## 2 gender      value    NA     NA   NA    NA    NA    
## 3 age         values   NA     NA   NA    NA    NA    
## 4 age         value    NA     NA   NA    NA    50    
## 5 color       values   NA     NA   TRUE  FALSE NA    
## 6 color       value    NA     NA   NA    NA    NA    
## 7 time_of_day values   NA     NA   NA    NA    NA    
## 8 time_of_day value    NA     NA   NA    NA    noon

Mi mancano alcuni trucchi per risolvere il problema.

Risposte

4 stefan Jan 04 2021 at 06:10

Un approccio ordinato per ottenere il risultato desiderato può assomigliare a questo:

library(tibble)

df_1 <-
  tribble(~key, ~values.male, ~values.female, ~values.red, ~values.green, ~value,
          "gender", 0.5, 0.5, NA, NA, NA,
          "age", NA, NA, NA, NA, "50",
          "color", NA, NA, TRUE, FALSE, NA,
          "time_of_day", NA, NA, NA, NA, "noon")

library(tidyr)
library(dplyr)
library(purrr)

df_pivoted <- df_1 %>% 
  mutate(across(everything(), as.character)) %>% 
  pivot_longer(-key, names_to = "level", names_prefix = "^values\\.", values_drop_na = TRUE) %>% 
  group_by(key) %>% 
  nest() %>% 
  mutate(data = map(data, ~ if (all(.x$level == "value")) deframe(.x) else .x))
df_pivoted
#> # A tibble: 4 x 2
#> # Groups:   key [4]
#>   key         data            
#>   <chr>       <list>          
#> 1 gender      <tibble [2 × 2]>
#> 2 age         <chr [1]>       
#> 3 color       <tibble [2 × 2]>
#> 4 time_of_day <chr [1]>

MODIFICA A seguito del chiarimento nei tuoi commenti sul risultato desiderato, potremmo semplicemente sbarazzarci dell'istruzione map come fine (che fondamentalmente era intesa per convertire le tabelle per le categorie senza livelli in un vettore) e aggiungere un'istruzione mutate prima di annidare per sostituire il livello con NA per le categorie senza level: