r - 根据数据子集的汇总统计重新排序因子
问题描述
我正在尝试从我的数据框的子集中重新排序一个因子,该因子由另一个使用forcats::fct_reorder()
.
考虑以下数据框df
:
set.seed(12)
df <- data.frame(fct1 = as.factor(rep(c("A", "B", 'C'), each = 200)),
fct2 = as.factor(rep(c("j", "k"), each = 100)),
val = c(rnorm(100, 2), # A - j
rnorm(100, 1), # A - k
rnorm(100, 1), # B - j
rnorm(100, 6), # B - k
rnorm(100, 8), # C - j
rnorm(100, 4)))# C - k
我想使用ggridges
包绘制多面组密度。例如:
ggplot(data = df, aes(y = fct2, x = val)) +
stat_density_ridges(geom = "density_ridges_gradient",
calc_ecdf = T,
quantile_fun = median,
quantile_lines = T) +
facet_wrap(~fct1, ncol = 1)
我现在想按每个方面上密度值的fct1
中位数(默认为)排序,即 where 。因此,此示例中的目标是分面以 B - C - A 的顺序出现。这似乎与此处的问题非常相似,不同之处在于我不想先汇总数据,因为我需要原始数据绘制密度。fct_reorder()
fct2 == "k"
我试图在链接问题的答案中调整代码:
df <- df %>% mutate(fct1 = forcats::fct_reorder(fct1, filter(., fct2 == 'k') %>% pull(val)))
但它返回以下错误:
forcats::fct_reorder(fct1, filter(., fct2 == "k") %>% pull(val)) 中的错误:
长度(f)==长度(.x)不正确
很明显,它们的长度不同,但我不太明白为什么这个错误是必要的。我的猜测是,通常不能保证fct1
子集中存在所有级别的 ,这肯定是有问题的。但是,在我的示例中并非如此。有没有办法解决这个错误,或者我做错了什么?
我知道我可以用几行额外的代码来解决这个问题,例如,创建子集数据的辅助变量,重新排序,然后将级别顺序作为我在原始数据集中的因素。我仍然想要一个更漂亮的解决方案,因为我经常面临同样的任务。
解决方案
你可以用一个小辅助函数来做到这一点:
f <- function(i) -median(df$val[df$fct2 == "k" & df$fct1 == df$fct1[i]])
这使您可以像这样重新排序:
df$fct1 <- forcats::fct_reorder(df$fct1, sapply(seq(nrow(df)), f))
这给了你这个情节:
ggplot(data = df, aes(y = fct2, x = val)) +
stat_density_ridges(geom = "density_ridges_gradient",
calc_ecdf = T,
quantile_fun = median,
quantile_lines = T) +
facet_wrap(~fct1, ncol = 1)
推荐阅读
- cuda - 如何更正 GPU 中每个块的线程数?
- scala - 在 Scala 中基于先前索引构建数组/列表的惯用方法
- c# - 将对象发送到标准输出 C#
- sql-server - While Looping Query gives Exception out of memory
- youtube-api - 经过身份验证的 youtube.videos.list 不再返回重复的视频
- javascript - 有没有办法使用jQuery在dom遍历中打印关闭元素?
- python - ValueError:“conv3d_66/convolution”的 1 减去 4 导致的负维度大小
- java - 如何修复 Spring Boot 控制器从 AJAX DELETE 请求中获取空数据?
- python - 如何使用肯定的lookbehind断言从单词“named”之后的字符串中提取子字符串
- r - 当数据中隐含嵌套时,我是否需要指定嵌套随机效果?