1. 时变数据
1.1. 时间是一个非常重要的维度和属性
1.2. 随时间变化、带有时间属性的数据称为时变型数据
1.2.1. Time-varying Data
1.2.2. Temporal Data
1.3. 时变型数据的处理方法与顺序型数据(Sequential Data)有相通之处
1.4. 数据类型
1.4.1. 数值型
- 1.4.1.1. 数值型数据可看成某种有具体数值的有序型数据
1.4.2. 有序型
- 1.4.2.1. 任意两个有序型数据之间都具有某种顺序关系
1.4.3. 类别型
1.5. 有序型数据分类
1.5.1. 以时间轴排列的时间序列数据
1.5.1.1. Time-series Data
1.5.1.2. Time-varying Data
1.5.1.3. 个人摄像机采集的视频序列
1.5.1.4. 各种传感器设备获取的监测数据
1.5.1.4.1. 在各类传感器网络、移动互联网应用中,以流模式(Streaming)生成的流数据(Streaming Data)是一类特殊的具有无限长度时间轴的时变型数据
1.5.1.5. 股市股票交易数据
1.5.1.6. 股市股票交易数据
1.5.1.7. 奥运会比赛日程
1.5.1.8. 每日高血压药物服用时间
1.5.1.9. 在时间序列数据中,每个数据实例都可以看作某个事件,事件的时间可当成一个变量
1.5.2. 不以时间为变量,但具有内在的排列顺序的顺序型数据集
1.5.2.1. 文本、生物DNA测序和化学质谱等
1.5.2.2. 变化顺序可以映射为时间轴进行处理
1.5.3. 统称为时变型数据
- 1.5.3.1. 在实际应用中量大、维数多、变量多,而且类型丰富,分布范围广泛
1.6. 历史动力学
1.6.1. 人类社会的微观活动和历史事件也构成了一个随时间变化的数据
1.6.2. Cliodynamics
1.6.3. 通过考察人口数量、社会结构、国家强盛程度和政局稳定性等变量,认为人类历史有经验性规律和周期性
1.7. 从特征计算的角度看,也可采用传统的数据挖掘方法对时变型数据进行信号分解、模式挖掘和特征预测等处理
1.7.1. 粒子滤波器
1.7.2. 卡尔曼滤波
1.7.3. 隐马尔科夫链
1.8. 针对大尺度的时变型数据,自动的数据挖掘方法往往难以预测蕴藏其中的千变万化的规律
1.8.1. 数据挖掘的结果通常带有噪声,需要*人工解释和滤波
1.8.2. 采用合适的数据可视化方法展现原始数据或分析后的结果,可有效地揭示数据中隐藏的特征模式,展示与时间相关的变化规律和趋势
1.9. 三个维度
1.9.1. 表达维度
1.9.1.1. 决定如何将时间信息映射到二维平面上
1.9.1.2. 可选的映射方式包括线性、径向、表格、螺旋形、随机等
1.9.1.3. 决定了时间数据以什么样的形式展现在可视化结果中
1.9.1.4. 在表达维度上最常用的是线性映射方式
1.9.2. 比例尺维度
- 1.9.2.1. 决定以怎样的比例将时序数据映射到可视化中
1.9.2.1.1. 对数比例尺
1.9.2.1.2. 线性比例尺
1.9.3. 布局维度
- 1.9.3.1. 决定以什么样的布局方式对时序数据进行排布
1.10. 可视化方法
1.10.1. 采用静态方式展示数据中记录的内容,不随时间变化,但可采用多视角、数据比较等方法体现数据随时间变化的趋势和规律
1.10.2. 采用动画手法,动态地展示随着时间变化的感觉和过程,因而具有更多的表现空间
2. 时间属性的可视化
2.1. 如果将时间属性或顺序性当成时间轴变量,那么每个数据实例是轴上某个变量值对应的单个事件
2.2. 线性时间和周期时间
2.2.1. 线性时间假定一个出发点并定义从过去到将来数据元素的线性时域
2.2.2. 季节的循环
2.2.3. 在一个严格的循环时间域中,不同点之间的顺序相对于一个周期是毫无意义的
2.2.4. 对于线性时间,在表达维度上最常用的就是线性映射方式
2.2.5. 对于周期时间,则经常使用径向和螺旋形的映射方式
2.3. 时间点和时间间隔
2.3.1. 离散时间点将时间描述为可与离散的空间欧拉点相对等的抽象概念
2.3.2. 单个时间点没有持续的概念
2.3.3. 间隔时间表示小规模的线性时间域
2.3.4. 数据元素被定义为一个持续段,由两个时间点分隔
2.3.5. 时间点和时间间隔都被称为*时间基元
2.4. 顺序时间、分支时间和多角度时间
2.4.1. 顺序时间域考虑那些按先后发生的事情
2.4.2. 对于分支时间、多股时间分支展开,这有利于描述和比较有选择性的方案(如项目规划)
2.4.3. 多角度时间可以描述多于一个关于被观察事实的观点
2.5. 不同类别的时变型数据需采用不同的可视方法来表达
2.6. 时变型数据中的其他属性可以采用不同的可视化通道表达
3. 日历时间可视化
3.1. 时间属性可以和人类日历对应,并分为年、月、周、日、小时等多个等级
3.2. 将日期和时间看成两个独立的维度,可用第三个维度编码与时间相关的属性
4. 分支和多角度时间可视化
4.1. 类似于叙事型小说,时变型数据中蕴含的信息存在分支结构,对同一个事件也可能存在多个角度的刻画
4.2. 分为线性、流状、树状、图状等类型
4.3. 可视化一般在表达维度上采用线性映射的方式对时间轴进行处理
4.4. 线性时间可视化方法允许普通用户在可交互的时间线上构造解释和标注,从而表达某个故事情节和事件发展
4.5. 流状分支时间主线可视化
4.5.1. 基于河流的可视隐喻可展现时序型事件随时间产生流动、合并、分叉和消失的效果,这种效果类似于小说和电影中的叙事主线
4.5.2. 更符合人类感知和认知的方法是采用静态的流状分支时间线可视化方法,在二维平面上展现这个动态过程
4.6. 时间属性的动态可视化
- 4.6.1. 尽管基于动画形式的可视化有着一定的局限性,也不是时变型数据可视化的主流,但在诠释某些动态事物的过程时,适当地采用动态可视化方法,有助于普通用户以可视的形式了解整个事件过程,达到一图胜千言的效果
5. 多变量时变型数据可视化
5.1. 多变量时变型数据是实际应用中常见的数据集
5.2. 对数据进行抽象和重构,以便刻画复杂有序数据集的内蕴特征,生成紧凑的概述图像,方便索引和搜索,进而允许用户在交互分析过程中添加其他细节
5.3. 数据抽象指通过数据降维、特征选取和数据简化等方法,构建增强关键特征而抑制不相关细节的表达,获得有序数据流的时间相关或无关的内蕴量或隐含的特征模式
5.4. 聚类
5.4.1. 指将数据集划分为多个具有某种相似性的子集的操作
5.4.2. 聚类过程实际上完成了对数据的抽象,因而允许对聚类后的集合进行分析和可视化,并在聚类基础上直接处理大尺度数据集
5.4.3. 核心是定义恰当的距离或相似性度量,而这与具体应用和数据集相关
5.5. 特征分析包括特征抽取、语义分析等操作
6. 基于线表示的可视化
6.1. 高维抽象的时变非空间数据通常蕴含宏观的、结构性的、随时间变化的规律
6.2. 第一步:高维曲线采样,采样的频率由用户交互指定
6.3. 第二步:将采样后的高维曲线分段,便于刻画每段曲线的特性,小段之间可以重叠
- 6.3.1. 分段尺寸、重叠程度也由用户交互指定
6.4. 第三步:用主元分析法将高维曲线投影到二维空间,显示和研究曲线特性
6.5. 采用静态方法可视化运动场景可用于精简、抽象、描述等目的
6.6. 采用动作捕捉(Motion Capture)设备获取的人体动画序列是高维的时变序列
7. 基于图结构的可视化
7.1. 基于事件的时变型或顺序型数据可视化的核心是事件演化的组织
7.2. 用户根据领域需求和任务描述关注点,并基于此从数据中找到与用户关注点实际匹配的事件,对事件分类获得不同类型
7.3. 根据事件类型的特征描述,从输入有序数据中检测事件,得到事件实例
7.4. 通过可视化方法将检测到的事件整合到可视表达中
7.5. 算法将数据中有语义的特定事件抽象为一个层次细节事件图
7.6. 以数据的特征作为节点,事件关系作为链接,对事件图的交互浏览或自动播放(以合适的起点和路径)形成解释性动画
7.7. 叶节点是一个简单的基本事件,如速度
7.8. 节点的子节点数目与该节点对应的时间区间中的事件复杂度有关
8. 时间序列数据的可视化交互
8.1. 直接可视化大规模的时变型数据难以呈现其全部细节,因此需要设计合适的交互方法表现重要的区域
8.2. 常用的一种交互手段是从时变型数据中查询特定的时间序列,以便交互地发现特征和趋势