r - 使用 dplyr 过滤数据集,取决于从 group by 检索到的最大值
问题描述
我有一个名为 nycbikes18 的 df,我想获取最常用的自行车(最常用的自行车 ID),然后检索该 ID 的所有数据
这是我的代码,它运行良好,但我想通过管道完成
nycbikes18 %>%
group_by(bikeid) %>%
tally() %>%
arrange(desc(n))
nycbikes18[nycbikes18$bikeid==26288,]
解决方案
这里有两个使用管道的选项dplyr
。我将mtcars
用作示例:
使用count
和加入
library(dplyr)
mtcars %>%
count(cyl, sort = TRUE) %>%
slice(1L) %>%
select(-n) %>%
left_join(mtcars, by = 'cyl')
# cyl mpg disp hp drat wt qsec vs am gear carb
#1 8 18.7 360.0 175 3.15 3.440 17.02 0 0 3 2
#2 8 14.3 360.0 245 3.21 3.570 15.84 0 0 3 4
#3 8 16.4 275.8 180 3.07 4.070 17.40 0 0 3 3
#4 8 17.3 275.8 180 3.07 3.730 17.60 0 0 3 3
#5 8 15.2 275.8 180 3.07 3.780 18.00 0 0 3 3
#6 8 10.4 472.0 205 2.93 5.250 17.98 0 0 3 4
#7 8 10.4 460.0 215 3.00 5.424 17.82 0 0 3 4
#8 8 14.7 440.0 230 3.23 5.345 17.42 0 0 3 4
#9 8 15.5 318.0 150 2.76 3.520 16.87 0 0 3 2
#10 8 15.2 304.0 150 3.15 3.435 17.30 0 0 3 2
#11 8 13.3 350.0 245 3.73 3.840 15.41 0 0 3 4
#12 8 19.2 400.0 175 3.08 3.845 17.05 0 0 3 2
#13 8 15.8 351.0 264 4.22 3.170 14.50 0 1 5 4
#14 8 15.0 301.0 335 3.54 3.570 14.60 0 1 5 8
或使用add_count
:
mtcars %>%
add_count(cyl) %>%
filter(n == max(n)) %>%
select(-n)
推荐阅读
- tensorflow - 我希望我的神经网络输出为 0 或 1,而不是 0 和 1 之间的概率,在输出层具有自定义阶跃函数
- javascript - 如何将 JavaScript 日期转换为 PostgreSQL 时间(无时区)?
- azure - 有什么方法可以查看 Azure 负载均衡器的访问日志
- r - 如何使用 ggplot 在数据框中绘制特定行
- swift - 未设置 Swift 包清单属性“defaultLocalization”
- python-3.x - 如何从子文件夹中的另一个 python 文件访问函数?
- .net - Dot.NET Core 5 路由
- node.js - 在 Paketo.io / Cloud Native Buildpacks 构建的 Docker 容器中运行 Nuxt.js
- java - mybatis select query is not returning result when one of the select parameters is null
- html - 如何在 css 中创建复杂的 3d 形状?(胶带带)