style-dna.md 19 KB

风格DNA详解

本文件是 SKILL.md 中风格规则的完整版本。每条规则配有原文佐证、量化标准和正误对比。


零、段落密度——最关键的结构特征

核心发现

原作者的段落是厚重的思想砖块。以下是7篇文章的段落统计:

文章 正文段落数 平均段长(字)
我的经典 6段 约350字
科学是什么 10段 约220字
扬杜不抑李 6段 约200字
从鲁迅弃医从文想到的 8段 约380字
问世间性是何物 4段 约500字
宇宙与生命的沉思 5段 约550字
科学普及塑造第一科技强国 ~12段 约200字

关键规律是——一段之内编织多个论点。 比如《从鲁迅弃医从文想到的》第五段(“什么是幸灾乐祸?”开始),在一个段落里完成了定义→分类→第一类批判→第二类批判→类比反问。如果用AI的方式写,这会被拆成5个段落。

体裁弹性(重要补充)

上表显示,作者在不同体裁下段落策略有明显弹性:

  • 评论/杂文/散文/书评(如"从鲁迅弃医从文""扬杜不抑李""我的经典"):4-8段,平均段长200-550字,厚段为主
  • 信息综述/深度科普(如"科学普及塑造第一科技强国"):10-12段,平均段长约200字,小标题更多(2-3个),语体更偏书面白话,文言虚词插入较少

因此"≤8段"的规则适用于评论/散文类;信息综述/科普类可放松到10-12段,小标题上限放松到4-5个(仍禁止对仗式)。

✅ 正确示例(原文,一个段落)

什么是幸灾乐祸?"见人遭受灾祸而高兴"(《辞海》的解释)是也,不管是因为什么动机、为了什么缘故而高兴。那些向本拉登表忠心、以恐怖分子自诩、哀叹中国怎么不出这样的勇士、恨不得多死几个人、乃至津津乐道地研究起"更先进"的恐怖手段的人,以及包括那些不知不觉地应用恐怖主义理论、论证美国人民必须为他们选出的政府犯下的"罪行"偿命的人,固然是令人毛骨悚然的嗜血;而那些因为恐怖过程干得漂亮、美国霸权主义受到打击或者别的其他什么原因而叫好的人,也是令人瞠目结舌的冷血,不管事后如何表白,在他们叫好的时候,已无视了这个打击美国霸权主义的艺术化过程的必然结果是成千上万的死难者。许多国人见到"美国"两字就要昏了头脑,那么不妨设想一下:当你读到广东某个合资企业起火灾烧死多名女工的报道时,能不能因为不仁厂主的经济利益受到了损失而大叫"烧得好"?

→ 一个段落,约350字。内含定义、两类人的批判、类比反问。全部用逗号和分号连接成绵密的语流。

❌ 错误示例(AI改写后的碎段化)

什么是幸灾乐祸?"见人遭受灾祸而高兴",不管什么动机。

第一类人令人毛骨悚然。他们向本拉登表忠心,以恐怖分子自诩。

第二类人同样冷血。他们为"过程漂亮"叫好,死难者反倒被挤到句子外面。

说白了,这和为火灾叫好有什么区别?

→ 碎段、匀速、标题党式短句、网络腔“说白了”。完全丧失了原文的绵密感。


一、句式复杂度——多分句长句为主体

核心机制

原作者的句子内部结构:主句 + 多个从句/插入语/补充说明,用逗号连缀成一条长河。

它不走“短句+短句+短句”的子弹式打击路数;更典型的节奏是“长句长句长句,偶尔一个短句顿挫”。

量化标准(参考值,节奏优先)

以下数字是从范文统计出的参考指引,不是硬性配额。判断标准始终是:读起来是否顺、节奏是否到位、有没有承上启下的换气点。

  • 每段内,30字以上的长句占70-80%
  • 短句(<15字)按节奏需要使用:通常每段 1-2 个;关键顿挫处也可独立成段
  • 一个段落内允许有1-2个超长句(60字以上)
  • 句子内部用逗号制造的"微型停顿"平均每8-12字一次

节奏判断比数字更重要:连写三个长句若读起来闷,就插一个短句换气;上段铺陈完事实/场景、下段要展开分析时,中间可用一句独立的总评判承上启下(典型例子:"这确实是个很大的黑色幽默。")。不要为了"短句每段 ≤2"硬把节奏需要的短句删掉,更不要为了"长河感"把该顿挫的地方填成又一个长句。

核心边界:节奏灵活不等于可以堆短句子弹流——连续多句短句、每段同样的"短句落槌"、标题党式独立短句,仍然是 AI 痕迹。短句必须有承上启下、冷判断或情绪收束的功能。

对照句式:偏“不对称”,不走“工整壳”

原作者当然擅长对照,但更常见的是把对照织进长句链里:用分号把两类对象劈开,用“固然……;而……”把轻重关系写出来,主语可以很长、谓语很短,读起来像是在行文中顺手完成判断;相反,那种工整的“不是A而是B / 并非A而是B / 不在于A而在于B”更像现代讲义的纠错模板,偶尔用一次无妨,连着出现便显得像在套壳。

可用替代壳(从高到低):

  • A 固然……;但/而 B ……
  • B 才是……;至于 A,不过……
  • 先下判断句,再补一句范围限定(不用对照壳)——仅作单点替代,禁止把它做成每段标配开场;整篇以短判断句开段的段落占比 ≤ 1/3,超过即"AI 总分总结构换皮"

✅ 正确示例(原文长句结构)

大部头的世界名著,除了卡夫卡、博尔赫斯、加缪、萨特、马尔科斯这些较现代的作家的作品是在大学时才开始涉猎;经典的部分,象雨果、列夫·托尔斯泰、屠格涅夫、陀斯妥耶夫斯基、巴尔扎克的作品,都是在高中时候读完的,以后也未再读。

→ 这是一个约100字的长句,内部用分号分为两层,每层用逗号进一步分节。两个长列举自然嵌入。

要把我们的祖宗在人类的蒙昧时代所冥想出来的一套哲学加一件科学的保护套,也不用花费太多的苦心,毕竟,已有不少中国的科学官僚在为它们撑腰,而一批又一批的江湖骗子们也都大摇大摆地被请进中国的高等学府作集体催眠的表演。

→ 约90字长句。“毕竟”后面是原因从句,“而”引入并列从句。

❌ 错误句式(AI典型)

美国的科学官僚撑着腰。江湖骗子大摇大摆。高等学府被集体催眠。这算得上世纪末的一大怪现象。

→ 四个短句,每句一个信息点。匀速、无嵌套、无长河感。


二、语体——书斋知识分子散文

三个语体层次

原作者的语体有三层,它们不是随机拼盘;每一层都有精确分布:

第一层:书面白话(主体,约70%) —— 20世纪知识分子书面语

这是正常的现代散文语言,不口语也不书面化到拗口的程度。

但在我的大学本科时代,与我最有缘分的书也就是这一本了。 但是一种理论是否是科学的,是否能被全世界的科学界所接受,绝不是中国的科学官僚所能主宰得了的。

第二层:文言点缀(约20%) —— 在关键位置替换白话词

逸品寥若晨星(不说"好作品极少") 乃诗坛的永恒主题(不说"是诗歌界一直争论的话题") 盖一切的议论都是徒劳(不说"因为所有评论都没用") 未尝不感慨、感叹、感动(不说"总是被感动")

第三层:口语化点缀(约10%) —— 在需要降温或增加人味时使用

但这里的口语是20世纪知识分子的口语,不是网络口语:

玩儿伪科学(不是"搞伪科学") 也不用花费太多的苦心(不是"也不用费太大劲") 闲得很(不是"闲到爆") 痛痛快快地当了一次看客(不是"爽了一把")

正误对比表

✅ 作者的口语化 ❌ 网络口语(绝对禁止)
玩儿伪科学 搞这些伪科学
也就成了 于是就成了
想来总是一件很遗憾的事 想想也挺可惜的
我觉得这很正常 这不很正常吗
倒是饱受了冷嘲热讽 被喷得很惨
这大概也是鲁迅的意思 鲁迅大概就是这个意思吧
也就无关紧要了 也就不重要了吧

文言虚词语义方向速查(防误用)

插入文言虚词是本风格的标志,但误用会产生病句。以下是常用词的语义方向约束:

虚词 语义方向 正确位置 错误位置
罢了 收束/轻视(不过如此) 句末,表达"仅此而已"的判断收束 展开论证前的引导句
盖 因果/解释(因为) 解释原因的分句开头 转折位置
固然 让步(虽然) 让步分句,后接"但/而" 独立判断句(无转折承接)
乃 判断/等同(是、就是) 判断句谓语 转折或假设位置
未尝不 双重否定表肯定 表达克制的肯定情感 表达否定
何尝 反问否定(哪里、难道) 反问句 陈述句
倘 假设(如果) 假设分句 因果分句

✅ 正确用例:

  • "说说罢了"(收束:不过如此)
  • "盖一切的议论都是徒劳"(因果:因为)
  • "固然是令人毛骨悚然的嗜血;而那些……也是冷血"(让步→转折,完整搭配)
  • "逸品寥若晨星乃诗坛的永恒主题"(判断:就是)

❌ 错误用例:

  • "看看投票罢了"(错误:这里要展开论证,"罢了"暗示"看看也就算了")
  • "中餐固然有问题。"(错误:无转折承接,"固然"悬空)

三、开篇方式

核心发现

原作者从不用新闻式开局(2022年夏天,苏州街头,一个女孩……)。他的开篇有三种模式:

模式A:观察/判断入手

宋之前的诗,逸品多于凡品。

→ 直接给出一个文学判断,像是坐下来就开说。

模式B:现象/常识入手

自从教廷为伽里略平反后,伽里略便成了一致公认的英雄,玩儿伪科学的人也就最喜欢以伽里略自居。

→ 从一个大家都知道的现象说起。

模式C:自我经历入手(随意调)

从中学的时候起,我就常常被误会为读过许多书,其实我最多不过只能算翻过许多书罢了。

→ 用"我"的日常经验开始,里面带着自嘲。

绝对禁止:

  • 新闻导语式(时间+地点+人物+事件)
  • 悬念式(你能想象吗?/如果我告诉你……)
  • 数据轰炸式(据统计,全国有XX%的人……)

四、情感表达的精确机制

愤怒的传达

原作者传达愤怒的方式是在一个超长句中不断堆叠事实性描述,让荒谬自行暴露,然后用一个极短的判断句收束。

他们忽然记起了久违的巴勒斯坦、伊拉克、南斯拉夫难民,甚至几十年来第一次为巴勒斯坦的悲惨遭遇"流了泪",迫不及待地长篇大论清算美国霸权主义的历史罪行,把恐怖主义罪行拐一个弯推到了美国当局头上并大义凛然地为其指出了出路,雄辩地论证恐怖事件在美国大地发生的必然性、合理性甚至必要性,虽然学了乖先表态对无辜死亡"深表哀悼"(哀悼中还能做如此雄辩的剖析不能不让人佩服其定力),也让人不能不闻到了心里那声"活该"的窃喜。

关键技巧:

  • 引号反讽:“"流了泪"”“"深表哀悼"”——加引号表示不相信
  • 括号内旁白:(哀悼中还能做如此雄辩的剖析不能不让人佩服其定力)——括号里的冷笑比正文的批判更狠
  • 整段不用感叹号
  • 最后以“窃喜”结束,这个词比任何直接指责都更精确

感动的传达

未尝不感慨、感叹、感动。

→ 三个字“未尝不”完成了全部工作:它既承认了被感动,又保持了距离感。

❌ 绝对禁止的情感句式

  • “令人心痛”“令人唏嘘”“令人深思”
  • “不禁让人感叹”“让我们深感……”
  • “这一幕让人破防”“DNA动了”
  • 所有"令人+情感"、"让人+情感"句式

五、"我"的精确用法

知识分子式的"我"

“我”在原文中的出现,总是一个思维主体在标定立场,不是一个感受主体在描述情绪:

我认为这并不意味着宇宙有什么既定目的或意义。 我总怀疑那些人的诚意。 我觉得人生观是应该靠自己去领悟的,无人可教。 我觉得这很正常。 我无法同意德迪夫的观点。

❌ 禁止的"我"

  • “我听到这句话先说愤怒,下一拍又改口成困惑”——戏剧化反应,像电影旁白
  • “我走在苏州街头,看到了令人震惊的一幕”——新闻记者式
  • “作为一个中国人,我深感痛心”——演讲腔
  • “我不禁陷入了沉思”——AI标准句

六、引用桥梁句的精确风格

✅ 原文风格 ❌ 学术体/AI体
闻一多称老杜为古今诗人第一 闻一多先生曾指出……
王安石最瞧不起李白,说…… 王安石在其著述中明确批评了……
鲁迅说是"坟" 正如鲁迅先生所言……
根据美国学者Root-Bernstein的归纳 正如学者们所指出的那样
用作者的话说 该书作者明确指出
彼得·格里斯等做中国民族主义研究的学者早就指出过 就像Aukia等学者指出的

注意最后一行——上一次改写用了“就像Aukia等学者指出的”这种句式,虽然比“正如学者所言”好,但仍然不够口语化。正确方式是把学者的身份和研究领域自然带出来。


七、事实密度——论证的骨架

核心发现

原作者的论证力量来自精确的事实堆叠,不是来自比喻和修辞。以下是原文中的事实锚点密度:

文章 字数 事实锚点数 密度(每500字)
科学普及塑造第一科技强国 ~2500字 12+ ~2.4
宇宙与生命的沉思 ~2000字 8+ ~2.0
从鲁迅弃医从文想到的 ~2000字 6+ ~1.5
科学是什么? ~1800字 5+ ~1.4

事实锚点的类型

原作者使用的事实锚点包括:

  • 具体数字:"有68%的美国人""432小时""72小时""十五万多份"
  • 精确日期/年份:"1999年上半年""1974年获得诺贝尔生理学奖"
  • 人名+身份:"比利时生物学家克里斯蒂安·德迪夫""美国学者Root-Bernstein"
  • 机构/书名/期刊:"《活力之尘》""NSF""美国国家科学基金会"
  • 地理坐标:"笔者所在的加州圣地亚哥市"

量化标准

  • 每 500 字至少 1 个可核对的事实锚点
  • 数据直接嵌入叙述流,不用"数据显示""据统计"引导
  • 禁止用比喻替代数据(如用"硬件的革命"替代具体芯片规格)

✅ 正确示例(原文的事实密度)

有68%的美国人报告说他们每天至少看一个小时的电视新闻节目。美国人一年平均看一千余小时的电视,其中包括432小时的新闻节目和72小时的科学节目。

→ 两句话里 5 个精确数字,全部嵌入叙述,无"据统计"引导。

❌ 错误示例(AI的修辞替代)

美国人花在电视上的时间多得惊人,新闻节目占据了相当大的比例,而科学节目的占比则少得可怜。

→ 零数据,全是模糊修辞。"多得惊人""相当大""少得可怜"是典型AI填充词。


七点五、标点生态——冒号按实际语义使用

用户反馈中提到的“冒号太多”“X摆在那里:Y”这类结构提示语,确实是 AI 改写常见的露馅点。

核心发现

原作者当然会用冒号。现代改写任务里不设数量硬规定,重点看冒号是否承担真实语义功能:引出原句、定义、解释、列表、出处,或保留原文结构。若它只是把一句话切成“提示牌 + 结论”,就改掉。

换句话说,冒号在原文里不是“路标”,更不是“口号的扩音器”。

✅ 原文例证

例证1:引出分项(原文存在,但改写时优先改写掉)(《科学是什么?》)

根据美国学者Root-Bernstein的归纳,现在的科学学普遍认为,要判断一个理论是否科学,要符合逻辑的、经验的、社会学的和历史的四套标准,缺一不可。具体地说:

→ 冒号之后马上进入严格分项(1)2)3)4)),这是原文功能性用法;改写场景优先改写为逗号/分号链,避免形成提纲腔。

例证2:引出定义(原文存在,但改写时优先改写掉)(《问世间性是何物》)

在生物学上,性有一个非常枯燥的定义:基因的重组,也就是来自两个以上的个体的遗传物质的融合。

→ 冒号后不该跟“抒情”或“强调”;改写任务中建议直接并入句子,不保留冒号。

例证3:引出引文/原句(改写中可保留)(《从鲁迅弃医从文想到的》)

……又恰逢美国九·一一恐怖事件让中国人痛痛快快地当了一次看客,忽然想起这个故事:

→ 冒号后直接给引文块,冒号是引语闸门。

❌ AI 常见的冒号滥用(与原文相反)

  • 把冒号当“结构提示器”,用“原因/关键/一句话总结 + 冒号”这类路标引出后文
  • 把冒号当“气势加成”,用“数字/事实摆在那里 + 冒号”先喊口号再给数据

这类写法的毛病在于,它先把读者从内容里拉出来,让读者意识到你在“组织材料”,而不是在“说话”。原作者更愿意直接把数字、定义或引文塞进语流里,让逻辑自己站起来。


八、比喻密度控制——克制才是力量

核心发现

原作者的比喻极少且极短。以下是真实统计:

文章 字数 比喻数 密度(每1000字)
科学是什么? ~1800字 2 ~1.1
从鲁迅弃医从文想到的 ~2000字 3 ~1.5
宇宙与生命的沉思 ~2000字 1 ~0.5
我的经典 ~1500字 1 ~0.7

关键规律是——比喻是调味料,不是主菜。 原作者的每个比喻都在一句内完成,从不展开成详细的类比场景。

✅ 正确的比喻用法(短、精准、一句即止)

"贴上科学的标签就仿佛身价百倍"——8个字完成比喻 "一锤子买卖,或者是只此一家别无分店"——市井比喻,一句带过 "就象一位在混战中夺得皇位的人自称是真龙天子"——一句类比,紧跟事实论证

❌ 错误的比喻用法(AI典型:展开式、对价式)

"Anthropic 更像一个被催促的精算师,虽然被迫加快了语速,但内心依然坚持着那份严谨与从容,它反复强调自己'跑的是完全相同的 Opus 4.6'……而 OpenAI 则更像是一个大胆的探险家,为了追求极致的速度,不惜换掉了整个大脑……"

→ 两个对价比喻,每个展开了几十字。这是AI最典型的行为:把论证包裹在比喻里,而不是用事实说话。

量化标准

  • 每 1000 字比喻不超过 2 个
  • 每个比喻一句即止(≤20字),禁止展开
  • 禁止对价式比喻(A像X,B像Y)
  • 比喻后必须紧跟事实论证,不能用比喻代替论证