Python 我可以使用SQL将存储为CSV(逗号分隔值)的表列的内容拆分为新表中的单独行吗?

Python 我可以使用SQL将存储为CSV(逗号分隔值)的表列的内容拆分为新表中的单独行吗?,python,sql,vba,excel,csv,Python,Sql,Vba,Excel,Csv,我看到有几个相关的问题和答案,但不完全是我需要的,所以我会问一个新问题。我有一个CSV文件,其中包含数千行商店库存数据,我希望将这些数据导入MS SQL Server数据库并使用SQL进行处理。导入CSV文件后,SQL表将有三列包含CSV数据。问题是,我需要将这个CSV数据放到单独的行中,以便对其进行更多的分析。我希望最后有两个表:通过导入CSV文件创建的原始表,以及通过拆分CSV文件创建的表。下面是这两个表的表示形式: /Table1 (the original CSV file). Fir

我看到有几个相关的问题和答案,但不完全是我需要的,所以我会问一个新问题。我有一个CSV文件,其中包含数千行商店库存数据,我希望将这些数据导入MS SQL Server数据库并使用SQL进行处理。导入CSV文件后,SQL表将有三列包含CSV数据。问题是,我需要将这个CSV数据放到单独的行中,以便对其进行更多的分析。我希望最后有两个表:通过导入CSV文件创建的原始表,以及通过拆分CSV文件创建的表。下面是这两个表的表示形式:

/Table1 (the original CSV file).  First row is column names:
StoreID,Date,StoreName,City,State,Category1CSV,Category2CSV,Category3CSV
1051,2/16/2014,Easton,Columbus,OH,"Flour,Yeast,Baking Powder","Milk,Water,Oil","Cinnamon,Sugar"
1425,1/14/2014,Crocker Park,Westlake,OH,"Baking Powder,Yeast,Flour","Oil,Milk,Water","Rosemay,Cinnamon,Sugar"
SQL列数据类型包括:

Table 1
StoreID - int
Date - date
StoreName - nvarchar(50)
City- nvarchar(50)
State- nvarchar(50)
Category1CSV - nvarchar(MAX)
Category2CSV - nvarchar(MAX)
Category3CSV - nvarchar(MAX)

Table2
StoreID - int
Date - date
StoreName - nvarchar(50)
City- nvarchar(50)
State - nvarchar(50)
ItemName - nvarchar(50)
ItemRank - tinyint
ItemCategory -tinyint
表1中标记为Category1CV、Category2CV和Category3CSV内容的列映射到表2列:ItemName、ItemRank、ItemCategory,其中ItemName是项目示例:面粉、ItemRank是CSV列表中项目的顺序,ItemCategory是1、2或3,具体取决于数据是否来自Category1CV,类别2CV或类别3CSV

除了拆分CSV列之外,最重要的方面是维护CSV列中项目的顺序。例如,StroreID 1051含有面粉、酵母、发酵粉等类别。这些将映射到ItemName、ItemRank和itemcegory列,以便ItemName=four、ItemRank=1和itemcegory=1。这将是表2中的第一行。第二行是ItemName=Yeast,它的ItemRank=2,itemcegory=1,依此类推,直到您得到上面的表2。此外,您会注意到ItemRank编号从列Category1CV的内容开始,然后继续到Category2CV,最后是Category3CSV

在那个冗长的解释之后,是否可以有一些SQL语句从表1为我创建表2?如果是,那会是什么样子?我计划使用MS SQL Server Express 2012


或者。。。正如有人向我建议的那样,最好在Excel或Python脚本中使用VBA,或者与Notepad++结合使用?要实现这一点,只需导入最终数据?无论哪种方式,我都不在乎,我只是无法继续手动编辑CSV文件,因为它非常繁琐和耗时。

我会使用Split函数来分割附加值

我使用的Split函数使用一个带有数字1到1000000的数字表,以方便拆分过程

一旦数字表和拆分函数就位,我将使用交叉应用函数将拆分应用于CSV列。分割CSV列的代码如下所示,这只是基于您提供的数据的两个测试行

DECLARE @Table TABLE (val1 VARCHAR(50), val2 VARCHAR(50), val3 VARCHAR(50), csv1 VARCHAR(100), csv2 VARCHAR(100), csv3 VARCHAR(100))
INSERT INTO @Table
VALUES ('Easton', 'Columbus', 'OH', 'Flour,Yeast,Baking Powder','Milk,Water,Oil','Cinnamon,Sugar')
 , ('Crocker Park', 'Westlake', 'OH', 'Baking Powder,Yeast,Flour','Oil,Milk,Water','Rosemary,Cinnamon,Sugar')

SELECT tbl.val1, val2, val3, apl.*
  FROM @Table tbl
 CROSS APPLY(
    SELECT val
      FROM dbo.Split(tbl.csv1, ',')
   ) apl

UNION ALL

SELECT tbl.val1, val2, val3, apl.*
  FROM @Table tbl
 CROSS APPLY(
    SELECT val
      FROM dbo.Split(tbl.csv2, ',')
   ) apl

UNION ALL

SELECT tbl.val1, val2, val3, apl.*
  FROM @Table tbl
 CROSS APPLY(
    SELECT val
      FROM dbo.Split(tbl.csv3, ',')
   ) apl
 ORDER BY val1
根据样本日期,其输出将如下所示

Crocker Park    Westlake    OH  Baking Powder
Crocker Park    Westlake    OH  Cinnamon
Crocker Park    Westlake    OH  Flour
Crocker Park    Westlake    OH  Milk
Crocker Park    Westlake    OH  Oil
Crocker Park    Westlake    OH  Rosemary
Crocker Park    Westlake    OH  Sugar
Crocker Park    Westlake    OH  Water
Crocker Park    Westlake    OH  Yeast
Easton          Columbus    OH  Baking Powder
Easton          Columbus    OH  Cinnamon
Easton          Columbus    OH  Flour
Easton          Columbus    OH  Milk
Easton          Columbus    OH  Oil
Easton          Columbus    OH  Sugar
Easton          Columbus    OH  Water
Easton          Columbus    OH  Yeast
下面是创建数字表的代码

DECLARE @tbl TABLE (n INT)
INSERT INTO @tbl (n)
VALUES (1),(2),(3),(4),(5),(6),(7),(8),(9),(10)

; WITH Num AS(
SELECT one.n
  FROM @tbl one
 CROSS JOIN @tbl two
 CROSS JOIN @tbl three
 CROSS JOIN @tbl four
 CROSS JOIN @tbl five
 CROSS JOIN @tbl six
)
SELECT ROW_NUMBER() OVER(ORDER BY n) AS n
  INTO dbo.Numbers
  FROM Num

ALTER TABLE dbo.Numbers
ALTER COLUMN n INT NOT NULL

ALTER TABLE dbo.Numbers 
ADD PRIMARY KEY (n)
GO
最后,这里是创建Split函数的代码

CREATE FUNCTION dbo.Split
(
@List VARCHAR(MAX),
@Delimiter VARCHAR(255)
)
RETURNS TABLE
AS
RETURN
(
SELECT val = SUBSTRING(@List, n, CHARINDEX(@Delimiter, @List + @Delimiter, n) - n)
  FROM dbo.Numbers
 WHERE n <= CONVERT(INT, LEN(@List)) 
   AND SUBSTRING(@Delimiter + @List, n, LEN(@Delimiter)) = @Delimiter
 );
GO

您是否考虑过使用Excel的文本到列函数而不是SQL?SQL在解析字符串数据方面不是最擅长的,编写一个过程来解析字符串数据是一件非常麻烦的事情……我也倾向于在Excel中解析字符串数据,然后将结果推送到SQL。@Phrancis-Text-to-columns为我提供了新的列,我需要新行。我刚刚研究了一些VBA。。。看起来很复杂。我需要根据、、进行拆分,将其复制到一个新列,对每个CSV列执行此操作,然后我需要填充其他列,然后根据CSV列表中项目的顺序为排名添加一个数字系列,最后告诉它是否来自名为Category1CV的列,然后ItemCategory的值=1,从名为Category2CVSV的列中,然后输入ItemCategory=2的值。如果我要在Excel中解决这个问题,等可能是我答案的一部分。好吧,如果你必须使用SQL,那么你可能想签出。不过,这是一个很好的警告,它不太漂亮。谢谢,我要试试这个!
CREATE FUNCTION dbo.Split
(
@List VARCHAR(MAX),
@Delimiter VARCHAR(255)
)
RETURNS TABLE
AS
RETURN
(
SELECT val = SUBSTRING(@List, n, CHARINDEX(@Delimiter, @List + @Delimiter, n) - n)
  FROM dbo.Numbers
 WHERE n <= CONVERT(INT, LEN(@List)) 
   AND SUBSTRING(@Delimiter + @List, n, LEN(@Delimiter)) = @Delimiter
 );
GO