首页 > 解决方案 > 使用 dplyr 过滤数据集,取决于从 group by 检索到的最大值

问题描述

我有一个名为 nycbikes18 的 df,我想获取最常用的自行车(最常用的自行车 ID),然后检索该 ID 的所有数据

这是我的代码,它运行良好,但我想通过管道完成

nycbikes18 %>% 
  group_by(bikeid) %>% 
  tally() %>% 
  arrange(desc(n)) 

nycbikes18[nycbikes18$bikeid==26288,] 

标签: rdataframedplyr

解决方案


这里有两个使用管道的选项dplyr。我将mtcars用作示例:

使用count和加入

library(dplyr)

mtcars %>%
  count(cyl, sort = TRUE) %>%
  slice(1L) %>%
  select(-n) %>%
  left_join(mtcars, by = 'cyl')

#   cyl  mpg  disp  hp drat    wt  qsec vs am gear carb
#1    8 18.7 360.0 175 3.15 3.440 17.02  0  0    3    2
#2    8 14.3 360.0 245 3.21 3.570 15.84  0  0    3    4
#3    8 16.4 275.8 180 3.07 4.070 17.40  0  0    3    3
#4    8 17.3 275.8 180 3.07 3.730 17.60  0  0    3    3
#5    8 15.2 275.8 180 3.07 3.780 18.00  0  0    3    3
#6    8 10.4 472.0 205 2.93 5.250 17.98  0  0    3    4
#7    8 10.4 460.0 215 3.00 5.424 17.82  0  0    3    4
#8    8 14.7 440.0 230 3.23 5.345 17.42  0  0    3    4
#9    8 15.5 318.0 150 2.76 3.520 16.87  0  0    3    2
#10   8 15.2 304.0 150 3.15 3.435 17.30  0  0    3    2
#11   8 13.3 350.0 245 3.73 3.840 15.41  0  0    3    4
#12   8 19.2 400.0 175 3.08 3.845 17.05  0  0    3    2
#13   8 15.8 351.0 264 4.22 3.170 14.50  0  1    5    4
#14   8 15.0 301.0 335 3.54 3.570 14.60  0  1    5    8

或使用add_count

mtcars %>%
  add_count(cyl) %>%
  filter(n == max(n)) %>%
  select(-n)

推荐阅读