未被external修饰的是内部表(managed table),被external修饰的为外部表(external table)。
区别
1. 内部表数据由Hive自身管理,外部表数据由HDFS管理;
2.内部表数据存储的位置是hive.metastore.warehouse.dir(默认:/user/hive/warehouse),外部表数据的存储位置由自己制定(如果没有LOCATION,Hive将在HDFS的/user/hive/warehouse文件夹下以外部表的表名创建一个文件夹,并将属于这个表的数据存放在这里)。
3.删除内部表会直接删除元数据(metadata)及存储数据;删除外部表仅仅会删除元数据,HDFS上的文件并不会被删除。
4.对内部表的修改会将修改直接同步给元数据,而对外部表的表结构和分区进行修改,则需要修复(MSCK REPAIR TABLE table_name;)。
创建内部表
CREATE TABLE IF NOT EXISTS b2( id int, name string, age int ) ROW FORMAT DELIMITED FIELDS TERMINATED BY ',';
hive> describe formatted b2; OK # col_name data_type comment id int name string age int # Detailed Table Information Database: default Owner: hadoop CreateTime: Sun Oct 24 02:44:00 CST 2021 LastAccessTime: UNKNOWN Protect Mode: None Retention: 0 Location: hdfs://hadoop1:9000/user/hive/warehouse/b2 Table Type: MANAGED_TABLE Table Parameters: transient_lastDdlTime 1635014640 # Storage Information SerDe Library: org.apache.hadoop.hive.serde2.lazy.LazySimpleSerDe InputFormat: org.apache.hadoop.mapred.TextInputFormat OutputFormat: org.apache.hadoop.hive.ql.io.HiveIgnoreKeyTextOutputFormat Compressed: No Num Buckets: -1 Bucket Columns: [] Sort Columns: [] Storage Desc Params: field.delim , serialization.format , Time taken: 0.218 seconds, Fetched: 29 row(s)
从上面我们可以看到表的类型Table Type为MANAGED_TABLE,即我们创建了一个内部表。
创建外部表
create external table b3(Name String, id Int,age int) row format delimited fields terminated by ',';
hive> describe formatted b3; OK # col_name data_type comment name string id int age int # Detailed Table Information Database: default Owner: hadoop CreateTime: Sun Oct 24 03:06:11 CST 2021 LastAccessTime: UNKNOWN Protect Mode: None Retention: 0 Location: hdfs://hadoop1:9000/user/hive/warehouse/b3 Table Type: EXTERNAL_TABLE Table Parameters: EXTERNAL TRUE transient_lastDdlTime 1635015971 # Storage Information SerDe Library: org.apache.hadoop.hive.serde2.lazy.LazySimpleSerDe InputFormat: org.apache.hadoop.mapred.TextInputFormat OutputFormat: org.apache.hadoop.hive.ql.io.HiveIgnoreKeyTextOutputFormat Compressed: No Num Buckets: -1 Bucket Columns: [] Sort Columns: [] Storage Desc Params: field.delim , serialization.format , Time taken: 0.226 seconds, Fetched: 30 row(s)
从上图中,我们可以看到,表的类型是"External Table".
什么时候使用哪种表? Managed Table数据是临时数据 外部的程序无法访问这些数据 数据会随着表的删除而删除External Table
数据可以被外部程序访问 你不能基于已经存在的表再创建表 表被删除时,数据不会被删除



