r - 在 R 中更新日期和日期间隔
问题描述
甚至不确定我是否在标题中准确地描述了这个问题,但这里有。
假设我有以下 data.table/data.frame:
library(data.table)
library(lubridate)
DT <- data.table(begin = c("2019-06-01 09:00:00","2019-06-01 09:00:00", "2019-06-01 09:00:00",
"2019-06-01 09:00:00", "2016-06-01 09:00:00","2016-06-01 09:00:00"),
end = c("2019-06-03 14:00:00", "2019-06-03 14:00:00", "2019-06-03 14:00:00",
"2019-06-02 05:00:00", "2019-06-02 05:00:00", "2016-06-01 23:15:00"),
person = c("A", "A","A", "B", "B", "C"))
begin end person
1: 2019-06-01 09:00:00 2019-06-03 14:00:00 A
2: 2019-06-01 09:00:00 2019-06-03 14:00:00 A
3: 2019-06-01 09:00:00 2019-06-03 14:00:00 A
4: 2019-06-01 09:00:00 2019-06-02 05:00:00 B
5: 2016-06-01 09:00:00 2019-06-02 05:00:00 B
6: 2016-06-01 09:00:00 2016-06-01 23:15:00 C
这本质上是一个数据集,总结了每个人一个时期的开始和结束时间的时间戳。每个人的行数按时间段跨越的天数重复。例如,人员A
具有相同“班次”的三个条目,因为他们的班次跨越三个不同的日期,06-01、06-02 和 06-03。条目按班次跨越的日期数重复,但有些班次在同一天开始和结束。
我想要的是更新上述数据集的开始和结束日期,这样我就可以看到每个班次的开始和结束时间。所以数据集应该如下所示:
begin end person
1: 2019-06-01 09:00:00 2019-06-02 00:00:00 A
2: 2019-06-02 00:00:00 2019-06-03 00:00:00 A
3: 2019-06-03 00:00:00 2019-06-03 14:00:00 A
4: 2019-06-01 09:00:00 2019-06-02 00:00:00 B
5: 2016-06-02 00:00:00 2019-06-02 05:00:00 B
6: 2016-06-01 09:00:00 2016-06-01 23:15:00 C
任何帮助将不胜感激!
解决方案
首先,修复日期(我已经修复了从 2016 年开始到 2019 年的第 5 行,似乎不太可能),
DT[, c("begin", "end"):=lapply(.SD, as.POSIXct), .SDcols=c("begin", "end")]
## we get this
DT <- as.data.table(structure(list(begin = structure(c(1559394000, 1559394000, 1559394000, 1559394000, 1559394000, 1464786000), class = c("POSIXct", "POSIXt"), tzone = ""), end = structure(c(1559584800, 1559584800, 1559584800, 1559466000, 1559466000, 1464837300), class = c("POSIXct", "POSIXt"), tzone = ""), person = c("A", "A", "A", "B", "B", "C")), row.names = c(NA, -6L), class = c("data.table", "data.frame")))
其次,我们再创建这个函数
func <- function(st, en) {
midns <- lubridate::ceiling_date(seq(st, en, by = "day"), unit = "day")
times <- unique(sort(c(midns[ st < midns & midns < en], st, en)))
data.table(begin = times[-length(times)], end = times[-1])
}
最后,我们使用它,by=.(person)
用于在输出中保留该列。我使用DT
,因为我们不需要(甚至不需要)每个班次/天的重复:
unique(DT)[, rbindlist(Map(func, begin, end)), by = .(person)]
# person begin end
# <char> <POSc> <POSc>
# 1: A 2019-06-01 09:00:00 2019-06-02 00:00:00
# 2: A 2019-06-02 00:00:00 2019-06-03 00:00:00
# 3: A 2019-06-03 00:00:00 2019-06-03 14:00:00
# 4: B 2019-06-01 09:00:00 2019-06-02 00:00:00
# 5: B 2019-06-02 00:00:00 2019-06-02 05:00:00
# 6: C 2016-06-01 09:00:00 2016-06-01 23:15:00
推荐阅读
- java - Java 9.0.4 和 Derby 10.14.2.0 和 Maven 找不到适合 jdbc 的驱动程序
- sql-server - 如何捕获导致批量插入错误的特定 ID
- spring - 如何在 SpringBoot 应用程序中同时使用 Myfaces 2.3、Primefaces Elite 7.0.4 & Extensions 和 Omnifaces 3.3?
- rest - RESTful API - 可选参数和重载与多条路由
- multithreading - 如何将纹理从上下文复制到 GPU 内的另一个上下文?
- android - 在 App Update API 中总是返回 1 (UPDATE_NOT_AVAILABLE)
- ios - CGRect 放大动画在 Xcode 10 中不起作用?
- ios - 使用 firebase 云消息传递的 swift 通知未接收到 iPhone
- android - 处理 RecyclerView 中的按下事件
- batch-file - Windows 2000 说超时不是命令或批处理文件